{"as_of":"2026-08-08T21:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0e7f288627001a8c3e8bf512313e9b04ad28c51b3a445a2f51fc69d43e89485","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:49:46.876113Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:43:37.510074Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:54:57.961666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:703ebf00b44313c8f27c0f88f49ca0b42d211de67d0c7ce97ed0ddc0667a7118","observation_id":"85ed9549-5a85-4e0b-9220-f9468c6cb2a5","resolution":{"observed_at":"2026-05-19T05:17:06.579621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T22:36:31.044743Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2508.13009"},"observation_digest":"sha256:559edd6660c8571a7e73ce2981a6d64f430c2ab58a2fcf13d5fb1910056d582e","observation_id":"6fe79ce5-4e09-44a6-9f1a-f37ed8288403","resolution":{"observed_at":"2026-05-18T22:36:53.261124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-08-04T10:43:37.510074Z","title":"Playing with transformer at 30+ fps via next-frame diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09036","last_updated":"2026-06-24T10:18:59Z","snapshot_observed_at":"2026-08-06T06:48:09.190707Z","submitted_at":"2025-10-10T06:15:42Z","title":"RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:43:37.510074Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2510.09036"},"observation_digest":"sha256:a7ea13fff273833075094b2b8dc62576823bc24d9d5194c076ed4a0d77701ead","observation_id":"2b2e644a-d463-4e90-9339-514e08ab82df","resolution":{"observed_at":"2026-08-04T10:43:37.510074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2604.09527","last_updated":"2026-04-10T17:46:05Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T17:46:05Z","title":"Envisioning the Future, One Step at a Time","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:41.904925Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2604.09527"},"observation_digest":"sha256:ac3238e4b8a37aaa0e023056f6571ed43a414746679cbaef61dd915d6ad73268","observation_id":"73a3b47d-225f-4037-bc31-628ccd0cdf46","resolution":{"observed_at":"2026-05-11T06:41:05.951388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:f3c4bf88192c6e3409561083521fe23a8c1d9ed11fe3d99e30be629693a38697","observation_id":"63b7fccf-b51d-41fe-a17e-679b03228f9c","resolution":{"observed_at":"2026-05-10T09:03:26.144191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:19.111071Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:657a477ca9b61d3212b9d9f9dc5a590f8af39e680d901c90d55fe7d11bf87a44","observation_id":"7f4661b4-163d-45c9-a1d4-182b8e7013ae","resolution":{"observed_at":"2026-05-21T05:29:39.422283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T17:50:22.258541Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:aefd0e0802b8ab89eb15677a7379c0f70dbf32408df09ca03bb82c7505dece5e","observation_id":"304a5c1b-a27a-4192-b7c2-c58efde9de4b","resolution":{"observed_at":"2026-06-30T17:54:57.963353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01380/citation-record","integrity":"/paper/2506.01380/integrity","json":"/paper/2506.01380/citation-record.json","paper":"/paper/2506.01380"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T11:49:41.669315Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.669315Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:5ea5c03042086f3d57cf71a0a604239ba2beec28d6338235b975f03af83e18b1","observation_id":"244b70f9-ebf8-4ce1-8757-fca7a6da178c","resolution":{"observed_at":"2026-08-07T11:49:41.669315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:41.724851Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.724851Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6f1ed436a7488747e3852ee73234dc51eb0d98180bb6b1b3f35326eb2f1324cd","observation_id":"fb49a71e-b600-4a27-bc94-5c19ddb3f2af","resolution":{"observed_at":"2026-08-07T11:49:41.724851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:50.074258Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":"d4f3c274-7ddc-44ca-8ce6-4d2fa9ffc453","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.780871Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:10630d146272b536e9fa3d535c68475ce86ac883a2a3efbd6798c731486996c7","observation_id":"01b31326-a147-4769-abcc-850662967b95","resolution":{"observed_at":"2026-08-07T11:49:50.211033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.909952Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":"dd142d74-adfd-4063-85be-d8e76de33a28","year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.831486Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:455c9158a3aee4998923e479d86c464df340b8951598dcdb6f9de599e81e181e","observation_id":"5052c2e3-eb6e-4d5b-ad36-2245576cd7ff","resolution":{"observed_at":"2026-08-07T11:49:49.982602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.729348Z","title":"Language models are few-shot learners","venue":null,"work_id":"93e5d34b-1315-48f1-8111-6fd0db256b9d","year":1901},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.879455Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:20a4dc3e9b47579b52ee57e0f6973bc092660b07db2b1886ce674db580d00098","observation_id":"ed5dc038-8008-495b-86fb-10591f58257b","resolution":{"observed_at":"2026-08-07T11:49:49.811589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:41.967656Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.967656Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:af5d8327aaaa10099a3932b063204bf4280c918e9602879fc4be89ff66087a27","observation_id":"0ec95660-fa27-44ff-895f-bd061699fefa","resolution":{"observed_at":"2026-08-07T11:49:41.967656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-07T11:49:42.051150Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.051150Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:0871bf45f007812fcfdb1de765a6a039a1782fcc73cbc2b9dd125d8196513675","observation_id":"d699f9dc-f578-41f3-9d70-722e4d6eaaa6","resolution":{"observed_at":"2026-08-07T11:49:42.051150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.114414Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.114414Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:fc73a926d5a078ccc577a64ffe85cee8f67fc2fd016f3fabe9116dce7e6ccafd","observation_id":"4419b65c-9ab0-42a4-971f-c21882a4a9c5","resolution":{"observed_at":"2026-08-07T11:49:42.114414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.153720Z","title":"Sana-sprint: One-step diffusion with continuous-time consistency distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.153720Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2e13832ee2a3277e8f68f2ea945a16076f463af943cf2755343cc88b9434d972","observation_id":"4f067ec0-c780-4392-ad75-32d7e4a8449d","resolution":{"observed_at":"2026-08-07T11:49:42.153720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-07T11:49:42.207829Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.207829Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:acbd72282b3656fd67e1e29a2d4ea8e8166730d38b8e5906d35053ee86a5b258","observation_id":"794491b1-9a61-44bd-8399-e6d5650962a6","resolution":{"observed_at":"2026-08-07T11:49:42.207829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00433","last_updated":"2025-02-01T13:46:02Z","snapshot_observed_at":"2026-08-04T23:22:54.180324Z","submitted_at":"2025-02-01T13:46:02Z","title":"CAT Pruning: Cluster-Aware Token Pruning For Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00433","snapshot_observed_at":"2026-08-07T11:49:42.283209Z","title":"Cat pruning: Cluster-aware token pruning for text-to-image diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.283209Z"},"links":{"cited_paper":"/paper/2502.00433","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:dee16f4d6d027338a26dff63922a7a3c105da395e3d1ea0b1dcd9b12dd7aa721","observation_id":"55a430e0-325c-4524-8c13-2f8e5b2eb418","resolution":{"observed_at":"2026-08-07T11:49:42.283209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.338890Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.338890Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6fb05eee69eb7cf167724dc26a34226ec8536766d152fa8521fcb8fd4fe52a9c","observation_id":"05958ecd-d84a-4b4a-8956-9ace4dfdf4f1","resolution":{"observed_at":"2026-08-07T11:49:42.338890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05636","last_updated":"2025-02-10T20:51:18Z","snapshot_observed_at":"2026-07-06T18:59:16.978029Z","submitted_at":"2024-08-10T21:24:25Z","title":"Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05636","snapshot_observed_at":"2026-08-07T11:49:42.399750Z","title":"Speculative diffusion decoding: Accelerating language generation through diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.399750Z"},"links":{"cited_paper":"/paper/2408.05636","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:3d9f02b1f7eb39201554f6a2d4637de6b85878e210d6c7d8e93d69e6064b69ac","observation_id":"614d844f-25fa-4288-b6c3-c257825fa05b","resolution":{"observed_at":"2026-08-07T11:49:42.399750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05370","last_updated":"2025-07-06T15:05:05Z","snapshot_observed_at":"2026-07-06T20:18:49.251617Z","submitted_at":"2025-01-09T16:50:16Z","title":"Accelerated Diffusion Models via Speculative Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05370","snapshot_observed_at":"2026-08-07T11:49:42.452683Z","title":"Accelerated diffusion models via speculative sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.452683Z"},"links":{"cited_paper":"/paper/2501.05370","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:7dd909caed5aba95c752f90571202951e83ec8339eaad65ef467304fbf76b59c","observation_id":"5a8c4109-0bdf-4b38-b94a-da12a55010be","resolution":{"observed_at":"2026-08-07T11:49:42.452683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.523209Z","title":"Oasis: A universe in a transformer","venue":null,"work_id":"73449082-6951-4fc2-a9ce-a37fd58f7f62","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.512389Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:baf56ae3bbade1d8de9257f17cebb59a5ee1d2a6cfb1bfb144af74e0865cdd6f","observation_id":"98710a6b-25bd-40cd-8280-d7ecc15005d5","resolution":{"observed_at":"2026-08-07T11:49:49.594996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.552838Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.552838Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:36f2251a4796a9ea244269b835f1ba62d91b2ef37aeb08cbd1d0c92aead961bd","observation_id":"555ffc70-71d1-4176-8a2d-8315aef0adf2","resolution":{"observed_at":"2026-08-07T11:49:42.552838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.628427Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.628427Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:d48ed7d1e7054ae7974d1605e92637826df95c3b858706bc4ef77271f2f97bf8","observation_id":"7e9145c7-2721-4514-a17c-e447792d10fb","resolution":{"observed_at":"2026-08-07T11:49:42.628427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.677994Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.677994Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:1f266cdcc363f36ccf4c7d8d248a972ff1050a6ec1123011aa55e05535d7d5c0","observation_id":"896a152c-dc74-46c7-9765-1834df733d95","resolution":{"observed_at":"2026-08-07T11:49:42.677994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.727555Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.727555Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:8dd525f566fe275e89a170d6a494a755122b2e8f0a31340a0a8aab2cf678d2b6","observation_id":"9b5c2a66-effd-4e70-91f4-e9e926a1d3d7","resolution":{"observed_at":"2026-08-07T11:49:42.727555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.309666Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":"6faaea43-faef-4003-852d-95cc38dc7bac","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.792368Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:67a4a98b265b1152aefe154eea204cc1f4cc5de56205af2624c144a5521ec985","observation_id":"25872947-c2bd-4564-9b4b-80de0aa5fc1c","resolution":{"observed_at":"2026-08-07T11:49:49.346082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-07T11:49:42.840907Z","title":"Long-context autoregressive video modeling with next-frame prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.840907Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:fb72074298f3228913664e32751042fc5e77208dbb7558da489acf3f199653b6","observation_id":"4ba8dbc8-c918-4eb4-b0d6-ad4fea3cc9e3","resolution":{"observed_at":"2026-08-07T11:49:42.840907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08388","last_updated":"2025-04-11T09:41:04Z","snapshot_observed_at":"2026-08-07T16:06:34.954758Z","submitted_at":"2025-04-11T09:41:04Z","title":"MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08388","snapshot_observed_at":"2026-08-07T11:49:42.913195Z","title":"Mineworld: a real-time and open-source interactive world model on minecraft","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.913195Z"},"links":{"cited_paper":"/paper/2504.08388","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:dbea2fd19e6a530e534263a7a4a7ca5119e677b85dc44e2b9c9b0aedd6d76257","observation_id":"92d671bb-a3a7-4acd-bea1-766cfceef618","resolution":{"observed_at":"2026-08-07T11:49:42.913195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-07T11:49:42.962948Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.962948Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:14a3eb0fd1aabf20422b3b7d1a7e3ac298e44c51b94c9b47b94f21d8b024d8b5","observation_id":"84a16ecb-f50c-4525-9fb5-88aa4bc0fa82","resolution":{"observed_at":"2026-08-07T11:49:42.962948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-07T11:49:43.016848Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.016848Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:88d290b2de226e2c10cce817392e0fd74551a18360bae5300074d37514dccc06","observation_id":"a041ef9d-72a0-4fe4-b8e4-6ee3aa4b97e1","resolution":{"observed_at":"2026-08-07T11:49:43.016848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T11:49:43.063242Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.063242Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:a150d85f57dd4070b08b1f0966e98f98dfd105af3b30ed479c997a6770092e87","observation_id":"27b1f4b2-18df-4db5-91f1-8708ce935c74","resolution":{"observed_at":"2026-08-07T11:49:43.063242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.167229Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"762dede9-bc00-4eda-9dc7-c88f6583aa53","year":2020},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.103930Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:fc79cef1cd564ffa4b64e5f1f76ae2e0059105a6e497fa09764a2fb0d70ba864","observation_id":"9b507f31-7b1a-4daf-ada6-45498c6f5a7b","resolution":{"observed_at":"2026-08-07T11:49:49.232940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-07T11:49:43.159204Z","title":"Gaia-1: A generative world model for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.159204Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:32ccd2b9d69d6ec0d96cea43436ae040aed706e543d2e22d103430f75f3f288f","observation_id":"8022c61b-1d09-4c0b-abe9-1a3830976dc7","resolution":{"observed_at":"2026-08-07T11:49:43.159204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.244093Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.244093Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:b4b34fc7544a96c873bbaca664b6ec7f90dac3a9b2533050c4595df7ad9e54d3","observation_id":"7eb626a3-f55d-4c06-b5b6-288a638f1d38","resolution":{"observed_at":"2026-08-07T11:49:43.244093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.969925Z","title":"Learning to simulate dynamic environments with gamegan","venue":null,"work_id":"4d306035-61ad-49d1-bbdd-77de2ee4f02f","year":2020},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.295706Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2406e853154c3821c25d57f563b47943055a4f4e4d1f7ff946310552176a769a","observation_id":"9b8a44f7-e077-45ec-9dc4-9a958dc95356","resolution":{"observed_at":"2026-08-07T11:49:49.072910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.344193Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.344193Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6a0c7d177d006cc3d23b1cadb1ce2d410934ae2cb9940fc43e7ba6f91bce9b01","observation_id":"f94f38e9-fc56-4ca3-9d86-bed4c5f7feca","resolution":{"observed_at":"2026-08-07T11:49:43.344193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.798256Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":"a849fe7c-7266-461b-96ea-1447878ae144","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.410746Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:9b9eecc8a42669cb742cf747c423e47ee4f6a0d15d27cfa3badd4e0c53fc6d82","observation_id":"d457942c-d70c-44ed-a610-bb856991f381","resolution":{"observed_at":"2026-08-07T11:49:48.865142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T11:49:43.465981Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.465981Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:69f864592128c1a8d8b335c8be9463b485aff1977a0ef4b8740863bea71ea3ca","observation_id":"0f3acd39-c673-4d9f-bd75-efd65314df84","resolution":{"observed_at":"2026-08-07T11:49:43.465981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.547324Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.547324Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:b41330a43d2e182d561aa104889fe36581b72707ba358094a8dba18f7cbe6667","observation_id":"831cc28a-985a-49d5-aeb2-ad88c629ebdd","resolution":{"observed_at":"2026-08-07T11:49:43.547324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.588354Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.588354Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:e29b28b8de423251c2c4cb1b2916b35a5954d1fe9e911fa31391d348cfce8ef3","observation_id":"9a681093-c219-414d-bba4-996fb72b1165","resolution":{"observed_at":"2026-08-07T11:49:43.588354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.645431Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.645431Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6015ef9e977308fa4a4f435c1950fc67187f4b8c6ce1ca700bdc6dce85391240","observation_id":"5a430c13-2701-412e-906a-22546058089c","resolution":{"observed_at":"2026-08-07T11:49:43.645431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.695257Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.695257Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:436efdeb7edcc417049c55478a31cbf3ed144f37cd83116b5ce77995ee7568ed","observation_id":"cb3697ee-4b98-462b-a585-1e7d43bee3cc","resolution":{"observed_at":"2026-08-07T11:49:43.695257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-07-06T19:33:30.263638Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-07T11:49:43.757089Z","title":"Simplifying, stabilizing and scaling continuous-time consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.757089Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:cea0850f7517bfcede8a188fd0f0ecbad1e0fcb6effb66c4fe77fcdfa9a5c994","observation_id":"a127a3b0-bf61-42ad-bc05-c61bcf86d895","resolution":{"observed_at":"2026-08-07T11:49:43.757089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-07T11:49:43.826343Z","title":"Dpm- solver++: Fast solver for guided sampling of diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.826343Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2666fdc8f69c85afb39e38d360b1a28847e75b0b1c3a8052c8b2077e562a4ab8","observation_id":"064070d2-898e-499e-9c37-14aa8aba7101","resolution":{"observed_at":"2026-08-07T11:49:43.826343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.894267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.894267Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:65c941c542a4f009ac82f954ffa1f7c356a2f5fcff13f1d61fcf85e444824b73","observation_id":"6c9bea53-8c1e-4823-9143-fe3bebe56106","resolution":{"observed_at":"2026-08-07T11:49:43.894267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.972665Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.972665Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2293a55391e1c6fd1fc8366d9615a680681573aec79ad24749cbe64f52746a49","observation_id":"50e4430f-ac5a-49a2-a0ec-fcb87473229b","resolution":{"observed_at":"2026-08-07T11:49:43.972665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.051513Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.051513Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:92f47e128f9069b664e1a289eced5bebcf75dad3040c482c831df6237c414532","observation_id":"997a0c0e-7b37-40d6-a318-66fe5816d0a3","resolution":{"observed_at":"2026-08-07T11:49:44.051513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T11:49:44.157194Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.157194Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:54e0f6e0490c47bea7e61d201641783ff8002bbfeeaee794ae47c992a17198cd","observation_id":"36275562-bb18-48f9-bcf3-fcbefeaf1c6f","resolution":{"observed_at":"2026-08-07T11:49:44.157194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.282569Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.282569Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:0a99020aeb7bb4d8feadd972bc6257999141ab015f5a6a09d190f5b300dbdbe7","observation_id":"d3a2258f-eda7-4680-9303-375ca7af16d0","resolution":{"observed_at":"2026-08-07T11:49:44.282569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-07-06T20:59:00.415760Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-07T11:49:44.373058Z","title":"Gaia-2: A controllable multi-view generative world model for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.373058Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6a26acd9858ffb8b94457022329a3d321a546ed820948a25b9e7908daf9d4c6f","observation_id":"758a92ba-c5cf-4ec5-bd22-2dad472cd609","resolution":{"observed_at":"2026-08-07T11:49:44.373058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-07T11:49:44.482801Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.482801Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c9f404790b3f526b29d8beb4162dbc9df848a427da92d89c0a16d9804c94e4d7","observation_id":"7ea15702-e171-45c5-b4bd-5e1ffcb05278","resolution":{"observed_at":"2026-08-07T11:49:44.482801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.524806Z","title":null,"venue":null,"work_id":"643ccd62-7155-44b8-9dc7-f7c374882765","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.610609Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:cb843e231ee314062dfee549fe6cb54fb543d683e8f662cfb5ab9d145cfe4f03","observation_id":"3afca255-798f-4e8b-93f6-76d4ff56c7fd","resolution":{"observed_at":"2026-08-07T11:49:48.625980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.715413Z","title":"Mastering atari, go, chess and shogi by planning with a learned model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.715413Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:19d9830c948a56d62088324be5acd0d307767d39cf8f4407721e4aa39ecfd71d","observation_id":"9014dacf-a4df-4dd1-abe8-536867e34a55","resolution":{"observed_at":"2026-08-07T11:49:44.715413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.809000Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.809000Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2222d1fd1c0e9a0b806517bde3ab1912beb10def0a40bb920bf62a3a5f5e3085","observation_id":"4139b3eb-4354-4a14-897b-c21ada20b60c","resolution":{"observed_at":"2026-08-07T11:49:44.809000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T11:49:44.911941Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.911941Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c93bd44762b31acb2ff56d819f4370e2269a0f2f71f7872b8440978b029a4744","observation_id":"669706dd-e7f9-4c9b-a152-c74416627bd0","resolution":{"observed_at":"2026-08-07T11:49:44.911941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:45.039508Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.039508Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:37b26505776888371746eb7a06f9ba07aac966778c55ddda793a0087d8c5f15d","observation_id":"4b69d8d2-a957-404b-bce3-5b9631ea15e5","resolution":{"observed_at":"2026-08-07T11:49:45.039508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-08T00:32:08.099689Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-07T11:49:45.159313Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.159313Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c9c513ff34f7feebf9726edd4bbd6e666611dfc31a438b75c12dfffd7d5adc84","observation_id":"ef69d201-f105-4960-bf9c-554ac4c7e766","resolution":{"observed_at":"2026-08-07T11:49:45.159313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:49:45.258191Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.258191Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:d598d041c4a705cf6092f008965339c621d329d96a7a790d9c8504dda3242c0f","observation_id":"82f4af78-8928-40ad-8d5b-fe5b1a6d6a93","resolution":{"observed_at":"2026-08-07T11:49:45.258191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T11:49:45.338761Z","title":"Towards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.338761Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:05515a84d2176286c506a74228709f77fb396089c8a4c9b108a82e03e977727f","observation_id":"8df5ef5d-437e-44bd-80e9-3c2672772843","resolution":{"observed_at":"2026-08-07T11:49:45.338761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T11:49:45.459923Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.459923Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:b20234fc16ba207cc82b37fede592bd079bd43a8048918604ab08ef49bfdb35b","observation_id":"a15bba91-5386-4aaa-bd82-07dc7b2dfcff","resolution":{"observed_at":"2026-08-07T11:49:45.459923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10445","last_updated":"2025-04-17T16:05:20Z","snapshot_observed_at":"2026-07-06T18:00:52.903522Z","submitted_at":"2024-04-16T10:31:06Z","title":"SparseDM: Toward Sparse Efficient Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10445","snapshot_observed_at":"2026-08-07T11:49:45.587972Z","title":"Sparsedm: Toward sparse efficient diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.587972Z"},"links":{"cited_paper":"/paper/2404.10445","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:09c7dd1bbd8ca6e873cf3197a9d61ca4e42bac770c6b329dd4702ebd6e7fbd91","observation_id":"a71b5ed8-f426-4118-bc98-ee61850d411f","resolution":{"observed_at":"2026-08-07T11:49:45.587972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:45.688193Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.688193Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:af8a2ae344f97153fe45922c4ad2e894b8622169cf544c8fcebc9b26c3fa3845","observation_id":"de718956-e0a8-4e10-ac15-e6ff202e9df5","resolution":{"observed_at":"2026-08-07T11:49:45.688193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:45.793677Z","title":"ivideogpt: Interactive videogpts are scalable world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.793677Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:354579cc2495dc00537b9445cb8b687a11f35ea2862da8d5ee2acaa0e56e68c6","observation_id":"944b68fc-c7cf-41f4-a0b2-7e15d97f381f","resolution":{"observed_at":"2026-08-07T11:49:45.793677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.317497Z","title":"Structured 3d latents for scalable and versatile 3d generation","venue":null,"work_id":"0e61bf29-68ea-4232-aa90-380caf59a01d","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.891921Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:a7d7827ae9a7b9091e2cf28d0b4c8fa0a72dbb1bdb4c1530aeb0daa493bbd9ab","observation_id":"5867bbd9-0c42-4daa-9eea-7c3cdbca4bb9","resolution":{"observed_at":"2026-08-07T11:49:48.368033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-08T08:58:45.984697Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T11:49:46.038383Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.038383Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:573f0570e5432c5ada45e59f2d675c39e366383576b62e0beffd023df7066445","observation_id":"006165f0-d22d-45b4-9a01-8dac9f634583","resolution":{"observed_at":"2026-08-07T11:49:46.038383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.094491Z","title":"Learning interactive real-world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.094491Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c63cc915de06b78f3d579915631951418e9f78fa5b9cfad0a99bd60dc5f12a83","observation_id":"0e869d7d-1207-4229-9ba0-c76a48058a43","resolution":{"observed_at":"2026-08-07T11:49:46.094491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T11:49:46.205356Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.205356Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6c178fb9a88226a714869bde2861aa6064e2418afa6f8d713a5579610554fa7f","observation_id":"76a209fa-6616-4f33-a3b4-a610861537af","resolution":{"observed_at":"2026-08-07T11:49:46.205356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.325346Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.325346Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c8dd3bd87a0f1dfbad93d991f7b7532e160d18562ca5c6ab6e5fc0507d63404a","observation_id":"3679763c-168a-4206-98dc-f77eea973d1c","resolution":{"observed_at":"2026-08-07T11:49:46.325346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.430341Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.430341Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:04acf2c0024783d73aeb3e54918fae88d353136c0b455210b4e546c81cdcebb2","observation_id":"595a32b9-49df-4289-9282-8ed39999edc2","resolution":{"observed_at":"2026-08-07T11:49:46.430341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09645","last_updated":"2025-08-20T18:39:27Z","snapshot_observed_at":"2026-07-06T20:06:13.565435Z","submitted_at":"2024-12-10T18:52:39Z","title":"Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09645","snapshot_observed_at":"2026-08-07T11:49:46.509630Z","title":"Evaluation agent: Effi- cient and promptable evaluation framework for visual generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.509630Z"},"links":{"cited_paper":"/paper/2412.09645","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2681707680346b07d6ed28549a6510cc7e4440480cab47a5c76190b93a7c97cd","observation_id":"fdf71b7a-fb16-4023-b770-e1a77b564d81","resolution":{"observed_at":"2026-08-07T11:49:46.509630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.115431Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"702cf254-9438-41f4-a979-999425054a2c","year":2018},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.632889Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:1a1c24886a7315e0cf59cb7645aaa65c199b33a4698c8a02b3b812ea5bbde35c","observation_id":"3cf5599f-d2c9-4bae-95ac-a89b1cab702f","resolution":{"observed_at":"2026-08-07T11:49:48.182571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:47.966528Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video gen- eration","venue":null,"work_id":"843abbba-b3f4-471b-844e-ba8531ec8595","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.727368Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:fe55821241d01f8a6f42dd337afac9ba28b6eee964b9cd9e56640f25b1091cef","observation_id":"9653b660-e1e2-4245-9f08-35784f3d887a","resolution":{"observed_at":"2026-08-07T11:49:48.009638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.822591Z","title":"Genad: Gen- erative end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.822591Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c428ceff360cf755f479a0b349488fb7c43e166e1edf269dd37ecd99f8d769ae","observation_id":"d75d06a7-22a2-4eef-add7-1fb68169bf7b","resolution":{"observed_at":"2026-08-07T11:49:46.822591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:47.810280Z","title":"\"\" model : Distilled NFD + model vid : Input video tensor act : Action sequence tensor","venue":null,"work_id":"d4e4c026-f184-4dbe-9b76-305857c1286b","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.876113Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:0361235b9b3a050ff7f0936fe4527d7ee4aa9981e1381b2eb05310b4d61e8ce6","observation_id":"2bba489d-707c-40e4-b46a-73d633d75228","resolution":{"observed_at":"2026-08-07T11:49:47.872390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:41:21.631626Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 7 inbound Pith citation observations for arXiv:2506.01380."}