{"as_of":"2026-08-11T01:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bff0d4a34c99708cfd98fd025e71d1088bb0dd6afb38bc7a20f7b557170d167e","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T15:07:39.718555Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":58,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:16:42.997910Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T11:41:02.772589Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:437f261a8c9e26c8ada7cdf35e40ed8205223b288b7db370ecabccbce59a4618","observation_id":"351ca4d4-d0e0-43e3-b8ea-cdfbfb372e8c","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T17:50:29.675358Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2503.00200"},"observation_digest":"sha256:6578bde26101591e4137b85b3a5d1c1db7e5883abcb7bc36d7270eec881acbfa","observation_id":"8ec2b89b-6235-47d5-84c2-3476b3164c24","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:0a7660a87b0fb3d6ad9c102ef1af3491bf7a24b5283ca36407fb3b77836f0139","observation_id":"9351a4d0-8d54-45d2-af3f-bb19625df75e","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-07T11:16:42.997910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03007","last_updated":"2025-06-03T15:45:41Z","snapshot_observed_at":"2026-08-10T00:48:35.502586Z","submitted_at":"2025-06-03T15:45:41Z","title":"DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:42.997910Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2506.03007"},"observation_digest":"sha256:26dc4670b09b79e2ba0bfb0d738e2cbe20969882d91f0c9b555c433b8785088a","observation_id":"37c23299-3855-48a5-ae6f-f3ebb672636f","resolution":{"observed_at":"2026-08-07T11:16:42.997910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-07T11:12:17.529993Z","title":"arXiv preprint arXiv:2412.14169 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-10T02:48:41.050656Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.529993Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:a8c5d6c039ee0df73fef278e6b69548e56fc863774093b1f75a93f2ebc03e307","observation_id":"5207c38b-a15d-4fc2-9cad-8683c84282c9","resolution":{"observed_at":"2026-08-07T11:12:17.529993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-07T00:30:58.367808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13691","last_updated":"2025-06-16T16:52:52Z","snapshot_observed_at":"2026-08-08T15:16:17.202058Z","submitted_at":"2025-06-16T16:52:52Z","title":"UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:58.367808Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2506.13691"},"observation_digest":"sha256:118e9ee7f7f62a384e2f213ce189c094eb0306fde86c0e4560f258044502ca53","observation_id":"b0f32f7b-3dde-4e5c-b581-75845d2181e4","resolution":{"observed_at":"2026-08-07T00:30:58.367808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-07T00:30:26.930658Z","title":"Autoregressive video generation without vector quantization.arXiv preprint arXiv:2412.14169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-08-07T22:16:51.604935Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:26.930658Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2506.14168"},"observation_digest":"sha256:f84a56e91b45c061bf0d1c20762ee23d8f21a4b4480e7fcaa1865e58f7d2bbb3","observation_id":"055f827a-7efe-48f8-85db-8aedcd009c02","resolution":{"observed_at":"2026-08-07T00:30:26.930658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:ede823b26b445d207de16be0acbce912f5571de622eec843f8a16fedc8018453","observation_id":"fa2b8a6e-77da-4bcc-bbff-be3e0c57eb34","resolution":{"observed_at":"2026-05-19T07:52:10.797784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-06T21:19:12.621023Z","title":"Autoregressive video generation with- out vector quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00472","last_updated":"2025-07-01T06:38:14Z","snapshot_observed_at":"2026-08-08T19:34:33.797020Z","submitted_at":"2025-07-01T06:38:14Z","title":"ARIG: Autoregressive Interactive Head Generation for Real-time Conversations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:12.621023Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.00472"},"observation_digest":"sha256:d832aed08ffc7da26c3ac039f6670026211f35118326abd52f5870efe15d9922","observation_id":"63c6b614-f7fe-41a4-9e96-bca4458caee4","resolution":{"observed_at":"2026-08-06T21:19:12.621023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-02T13:47:45.555967Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:1462bb5b12ff114be968f7dcaa72fe9e9d748a951aeb53e70237f243024858fd","observation_id":"2d1a1932-63a9-4f17-afee-c4073be0e256","resolution":{"observed_at":"2026-05-22T00:14:27.855764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-06T20:43:54.436324Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-10T19:30:42.529309Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.436324Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:948285820bb8e7fc46f474fcd78d8b2636a793f7b6d818edf2b0fd76aca5b4b0","observation_id":"54f45424-b34c-4608-89b0-aff910a20f3f","resolution":{"observed_at":"2026-08-06T20:43:54.436324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-06T20:42:37.166568Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:37.166568Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7d2d5cb3b0f9955d32b910fa750ed37cda98ab8b50ce0ff799647d552f3455df","observation_id":"44129b92-9419-4a66-8bf1-88f408c28577","resolution":{"observed_at":"2026-08-06T20:42:37.166568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-06T17:49:43.278789Z","title":"Autoregressive video generation with- out vector quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09862","last_updated":"2025-07-14T02:22:47Z","snapshot_observed_at":"2026-08-06T17:43:06.615236Z","submitted_at":"2025-07-14T02:22:47Z","title":"SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:43.278789Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.09862"},"observation_digest":"sha256:e12d374465754a09771ed2efd33a56283a4ce096be20fdf61327ab447acce5ff","observation_id":"6fc87888-0d09-4247-820f-409d8cb5825b","resolution":{"observed_at":"2026-08-06T17:49:43.278789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-06T14:53:34.850039Z","title":"arXiv preprint arXiv:2412.14169 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17388","last_updated":"2025-07-23T10:32:20Z","snapshot_observed_at":"2026-08-10T02:26:27.891741Z","submitted_at":"2025-07-23T10:32:20Z","title":"EndoGen: Conditional Autoregressive Endoscopic Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.850039Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.17388"},"observation_digest":"sha256:9d15078b83d8633abf6e762e02e53dfe3c7b987284bf07616738481cffe28fdd","observation_id":"6df5ccd9-a5a0-429a-8c36-59d1980debda","resolution":{"observed_at":"2026-08-06T14:53:34.850039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-05T22:04:35.528142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07603","last_updated":"2025-08-11T04:13:32Z","snapshot_observed_at":"2026-08-09T19:22:11.032860Z","submitted_at":"2025-08-11T04:13:32Z","title":"LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:04:35.528142Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2508.07603"},"observation_digest":"sha256:714649710d0bfef0438e9bbe22f9c0c621e3a7bc38425925fe2a048bba4795bc","observation_id":"0037e690-690b-45a8-97cf-52e456ca73c9","resolution":{"observed_at":"2026-08-05T22:04:35.528142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-05T20:50:28.990588Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09827","last_updated":"2025-08-13T14:03:10Z","snapshot_observed_at":"2026-08-10T02:26:33.673702Z","submitted_at":"2025-08-13T14:03:10Z","title":"Time delay as the origin of oscillations in anodic Si electrodissolution","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:28.990588Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2508.09827"},"observation_digest":"sha256:b759dfe614f6a5f1616e300f5269155894b98f970bde29683470161a79240fa9","observation_id":"eb7614c7-ce69-41a6-b982-5ce792142903","resolution":{"observed_at":"2026-08-05T20:50:28.990588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-05T20:44:11.606456Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.606456Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:bd20f577df7ee02bd7d4552c31c8382dd01fffffcf0fd829d45b9e98b9fb0d13","observation_id":"2495bef3-5bb7-47dd-8736-453fa1f105bd","resolution":{"observed_at":"2026-08-05T20:44:11.606456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-05T17:19:10.290358Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16512","last_updated":"2025-08-22T16:35:19Z","snapshot_observed_at":"2026-08-07T08:47:26.164430Z","submitted_at":"2025-08-22T16:35:19Z","title":"Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:19:10.290358Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2508.16512"},"observation_digest":"sha256:104d0255b943c191f1be68feafed1f3214e9b6b9d8733b30e24332a6f2be2c85","observation_id":"4b549c20-3f91-4f77-8651-04a44c2cc22b","resolution":{"observed_at":"2026-08-05T17:19:10.290358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-04T16:43:50.095402Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12046","last_updated":"2026-07-04T12:10:43Z","snapshot_observed_at":"2026-08-09T23:52:33.701843Z","submitted_at":"2025-09-15T15:27:29Z","title":"Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T16:43:50.095402Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2509.12046"},"observation_digest":"sha256:8a88f5d32f73114220c4c8370b6e6200751bc5dfdf189dc1b9529803901e1f1a","observation_id":"94c79c94-816a-42fb-a940-c0c35e37a77b","resolution":{"observed_at":"2026-08-04T16:43:50.095402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-09T17:36:50.125769Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T22:39:53.995700Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2510.02283"},"observation_digest":"sha256:2d365d690bc9d32e75be15f2b33d462e97203141a82eb03466862d2fd45cc52e","observation_id":"0919221f-f361-4d8f-96f1-cda18cda724c","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:b9985deeb94eeae6714c542f9adf4aa71b3b378f5db73fc1c98865c3162978ef","observation_id":"751c4310-f2ca-4380-9db0-e277bdeec8e1","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-03T18:30:02.314605Z","title":"Autoregressive video generation with- out vector quantization.arXiv preprint arXiv:2412.14169,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05044","last_updated":"2026-07-08T17:50:45Z","snapshot_observed_at":"2026-08-03T18:29:59.896456Z","submitted_at":"2025-12-04T17:59:10Z","title":"Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:30:02.314605Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2512.05044"},"observation_digest":"sha256:3c6a390383aaa8c33662faee5a359e10ae649e6acc4e73666b620fa18f669a47","observation_id":"0cff635c-11b3-461d-a07b-1954c6bd875f","resolution":{"observed_at":"2026-08-03T18:30:02.314605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-03T15:46:06.827425Z","title":"Autoregressive video generation without vector quantization.arXiv preprint arXiv:2412.14169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-06T15:52:47.972204Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T15:46:06.827425Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2512.15702"},"observation_digest":"sha256:5b88561557e4776f2c26047c6e396b14d071b4ad3df2e8801aa00596203ee4b9","observation_id":"42af0742-2a6e-4b11-a7e6-0cc6433a0b69","resolution":{"observed_at":"2026-08-03T15:46:06.827425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T17:32:01.642256Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:d7510787daa871b2ca45001716d440dad7be041cb555fb4d32e74d5a496a194f","observation_id":"ba79bc34-0b9d-445a-8fa8-f265657c0f59","resolution":{"observed_at":"2026-05-21T17:32:01.700503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T11:48:00.633421Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:94d4e2f3ef1c7b78c72f9db3151a6ee5b78b2fc3d5acd03d7356c742f7a53a14","observation_id":"125742e8-fed2-4658-9a80-29c6c6a1c0c0","resolution":{"observed_at":"2026-05-22T11:51:29.724763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-03T05:30:24.520144Z","title":"Autoregressive video generation without vector quantization.arXiv preprint arXiv:2412.14169,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T05:30:24.520144Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:efdb6240ae03ffa321f978b7faebc0fc286597e6800dcb41b6cd3a92102a2149","observation_id":"c1cc0199-19f8-42eb-ae64-41afddfd3ae6","resolution":{"observed_at":"2026-08-03T05:30:24.520144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:788c7c01783259d8b3acab226c4cdad0716ffa4ca59dc1e420f231a9d6db9cbe","observation_id":"1c5145e8-2e33-46cc-bc1d-60a8dfd6993d","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:997aab1c1e74608c47fc9059a4b4da7e66d671b710ff6606660e0365e70326b8","observation_id":"dbbbec27-db6d-43d8-b957-1c4d35bc4696","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-07-06T22:47:11.228912Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:dda9583f4d2d1ee709a1123ef02faa2cea85645dbe4c5134535fccb936eb23a9","observation_id":"b04dd9ce-9fd5-48ba-8d18-722905a52601","resolution":{"observed_at":"2026-05-21T11:40:03.340552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-08-10T22:29:48.430468Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T21:22:41.935691Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2603.00110"},"observation_digest":"sha256:896d5c116225e40ca86f63c0becdca2a9d6a83fe86c99d5c4808434145a7e6a1","observation_id":"cfa52c45-6ae9-461b-abd8-29f00bcf1faf","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-14T21:09:36.040879Z","title":"arXiv preprint arXiv:2412.14169 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14526","last_updated":"2026-06-28T22:57:12Z","snapshot_observed_at":"2026-08-10T14:27:22.776378Z","submitted_at":"2026-03-15T18:07:29Z","title":"LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T21:09:36.040879Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2603.14526"},"observation_digest":"sha256:1ecb23b263c2c5b162a1af19efa300c4a0024274f46182c456c3643be01c5b89","observation_id":"d95a30d8-84db-4047-ac6b-22ab82f701ae","resolution":{"observed_at":"2026-07-14T21:09:36.040879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2604.06966","last_updated":"2026-04-08T11:30:35Z","snapshot_observed_at":"2026-08-02T04:51:58.286670Z","submitted_at":"2026-04-08T11:30:35Z","title":"MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:50.105629Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2604.06966"},"observation_digest":"sha256:8fb1840d9f1821a024ebae9916c5938d3c5d14dd8d938aa74627b7a6b1d74557","observation_id":"87d909ab-6efa-441a-b843-23996e9273ea","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2604.10103","last_updated":"2026-04-28T08:33:18Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T08:54:07Z","title":"Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:54.363560Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2604.10103"},"observation_digest":"sha256:2f92c04b5aa2395850e5970fdd389f71b9b93efe9a1a68ff0f62d678f99c791e","observation_id":"961383c7-fd5e-4b28-89fa-2655eeaa25c5","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:41:23.057949Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:4096ac3d21d0c240570e213af0bd523668c2b085efc308d61399a708de909561","observation_id":"cd1d0b0a-49a1-47a9-b1f5-0a1f1c2bdfc5","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-12T21:00:35.123495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T21:00:35.123495Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:11fe937f2c81f9cca00b3babb0745cbf70763e3048e3c0d5a7c2227d6d5d9da1","observation_id":"258d27ad-1aca-4546-a70e-80d5ffdfd2ec","resolution":{"observed_at":"2026-07-12T21:00:35.123495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:812b197c9303fac1f4a4aa3e24d9fa7b543fa6d7cd5875b593a539f51aac3351","observation_id":"754a4ad8-18e5-4294-87d1-b219f0a138f9","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-11T01:01:02.208278Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T05:32:54.235578Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:748218404475b44fb32c42ce4eb06ff133d72a462a01e07d6f1f05c342f3cf29","observation_id":"7bf1de98-dbd6-482b-bcfa-a72773fce9b2","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-11T01:01:02.208278Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-05T11:32:38.636335Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:e31c7b5d787c820923f25ef05804e144fdf000e43428537aca93c498ca207e0d","observation_id":"00f966d5-e693-450b-955b-7caf90ae087f","resolution":{"observed_at":"2026-07-05T11:41:02.773900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.03849","last_updated":"2026-05-05T15:15:30Z","snapshot_observed_at":"2026-08-10T21:16:02.247069Z","submitted_at":"2026-05-05T15:15:30Z","title":"Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T17:38:08.199955Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.03849"},"observation_digest":"sha256:8394915bd164514e914adcf101b39d633bf8d0a9cf97b8495193057a658990b3","observation_id":"42985d31-453a-4623-b7a7-562518962d7a","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:eeb07f9003316bc0820dbae3f395b6b6afc6c92d2c891a435b4593645aeaa120","observation_id":"ad65406b-a55c-40de-8ae7-716a00eba102","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.06356","last_updated":"2026-05-09T12:33:33Z","snapshot_observed_at":"2026-08-10T22:32:44.349872Z","submitted_at":"2026-05-07T14:34:23Z","title":"SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T13:28:05.540719Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.06356"},"observation_digest":"sha256:ab46fa878dbd50f38324fdded396c84f59218345f4a1b7813b1d5099c2a698db","observation_id":"6233f6b5-b622-43ca-a850-0f324940e4ef","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.06356","last_updated":"2026-05-09T12:33:33Z","snapshot_observed_at":"2026-08-10T22:32:44.349872Z","submitted_at":"2026-05-07T14:34:23Z","title":"SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:50:30.588220Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.06356"},"observation_digest":"sha256:a0858dd2a082d9d9826ca57eaef9fff7e346c28f9ed06d03a4af112f7825c21b","observation_id":"f26a2bc8-6088-477d-87f4-51b47084a11e","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.15141","last_updated":"2026-06-01T14:27:49Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:46:36Z","title":"Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T20:59:34.847496Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.15141"},"observation_digest":"sha256:603273506e270394185956eb3a4baeb08d40f65acd6de54e7169d89993730fb8","observation_id":"cbace986-40fa-46a0-af03-ccc006540f66","resolution":{"observed_at":"2026-06-30T21:05:04.401478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.18233","last_updated":"2026-05-18T11:28:45Z","snapshot_observed_at":"2026-08-01T23:39:03.834779Z","submitted_at":"2026-05-18T11:28:45Z","title":"Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T10:56:16.054496Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.18233"},"observation_digest":"sha256:d7d0e2f5502f2ed21265bfcf804d64e5974eb015c7f56b4b7041177c589ae074","observation_id":"232d82d5-f957-450c-8fad-e9b2a5c9c16b","resolution":{"observed_at":"2026-05-20T10:58:13.907649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.24962","last_updated":"2026-05-24T09:28:05Z","snapshot_observed_at":"2026-08-02T19:14:30.533296Z","submitted_at":"2026-05-24T09:28:05Z","title":"Tempered Self-Similarity Alignment for Physically Plausible Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T11:39:06.597513Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.24962"},"observation_digest":"sha256:1bb7e1a51ea7a4fd8459a7f26bdf1af4a729a0df81c9f52944a547a02f050ebb","observation_id":"17874482-b131-4eae-9f49-992b5b751083","resolution":{"observed_at":"2026-06-30T11:44:38.368550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.30083","last_updated":"2026-05-28T15:30:04Z","snapshot_observed_at":"2026-08-08T04:25:10.823052Z","submitted_at":"2026-05-28T15:30:04Z","title":"Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T08:30:00.438334Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.30083"},"observation_digest":"sha256:4fa2e8a7243bdb46a94aa2c1137edefb234166ca1bb11309001d47d3c3701ad9","observation_id":"72131ca2-d689-4239-85f5-040d1357d81a","resolution":{"observed_at":"2026-06-29T08:33:15.185456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.30351","last_updated":"2026-05-28T17:59:57Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:57Z","title":"VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T08:17:30.660009Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.30351"},"observation_digest":"sha256:a1bb4b5a221b80b56626d21d697682fa9837abec35db637cdd2c349f61d18881","observation_id":"80cdf9a3-9b43-4ca3-aa06-69f76d952d08","resolution":{"observed_at":"2026-06-29T08:23:15.470700Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.30519","last_updated":"2026-05-28T19:56:00Z","snapshot_observed_at":"2026-08-07T21:20:03.682399Z","submitted_at":"2026-05-28T19:56:00Z","title":"OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T07:56:40.001739Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.30519"},"observation_digest":"sha256:b8c5f6889c7a0dac74be8e7b058e7a0723d1a734fd7245c182bac418be282f63","observation_id":"4ef15f71-4345-417a-920f-9c3e1eaf58ac","resolution":{"observed_at":"2026-06-29T08:03:14.442846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-01T15:38:52.805916Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:10c0b54cd2895b97550d1d53419ef789df028193588555b6a1c31a243800ce3b","observation_id":"1cea5fc4-4361-44ea-b3f7-9724a7fc8d2a","resolution":{"observed_at":"2026-07-01T19:16:00.548835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2606.04527","last_updated":"2026-06-03T07:09:01Z","snapshot_observed_at":"2026-08-06T03:22:24.182739Z","submitted_at":"2026-06-03T07:09:01Z","title":"Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T03:27:02.232039Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2606.04527"},"observation_digest":"sha256:c024c40299a19f0a9c492704d2f199821ff9d9ecc8ace67e682eafaba8264894","observation_id":"4a955319-5665-4808-9d7b-2ea813439bed","resolution":{"observed_at":"2026-07-02T11:36:54.891991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2606.06309","last_updated":"2026-06-04T15:49:37Z","snapshot_observed_at":"2026-08-02T23:02:02.731697Z","submitted_at":"2026-06-04T15:49:37Z","title":"RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:08:44.257127Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2606.06309"},"observation_digest":"sha256:1b82a6a95dbec1be9e36dcb7a95331d5adc2d11d3cd3540c529e2d8599b88b38","observation_id":"c0f77ff5-ed0e-4565-8463-48316811bc7b","resolution":{"observed_at":"2026-07-02T12:26:56.753440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-03T05:46:19.564000Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:b944d73e9489644e8c20de2883356fd9990d3c714249b0f3c0abd031cb16bc1a","observation_id":"c03865b5-3d37-4c5e-a2c1-3ca446ac045a","resolution":{"observed_at":"2026-07-04T04:09:35.537094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2606.27964","last_updated":"2026-06-26T11:08:09Z","snapshot_observed_at":"2026-08-08T15:58:26.026893Z","submitted_at":"2026-06-26T11:08:09Z","title":"Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T05:03:56.624536Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2606.27964"},"observation_digest":"sha256:6fd6b23a89325f1395467efab03f08e9d2a12a89650c3b5c5bc98fc532d3e9ce","observation_id":"e8c8ac01-1033-4e6d-b31e-652dbbf30444","resolution":{"observed_at":"2026-06-29T18:43:51.126020Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:05698307134aa2b6ba48257190e6d20536ded0500c4b3edf24a58032a789c8a5","observation_id":"b372428d-11ca-40b9-b4f2-e6110e65fb3b","resolution":{"observed_at":"2026-07-01T10:05:40.227463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-08-07T09:44:34.339704Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:6f9ad0e1e936b080430e60e78f5cd13c6cb036ddb00b7c743b03001510e51657","observation_id":"c999d9ed-8cc8-44a0-9c0c-b14696254935","resolution":{"observed_at":"2026-07-01T10:25:41.898990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Autoregressive video generation without vector quantization.arXiv preprint arXiv:2412.14169,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:a9f884ff744712dc8efc582a4d25733d215c155757156828cf92f8b117943adc","observation_id":"47d66d47-afbf-432e-b25a-c946ecd9fb70","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-08-10T12:47:12.656347Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:6bee27d96a02382695ed5eadeb3c56c1489445f36fd6104229f2d73e2d0b3f1c","observation_id":"1c05b8ef-2299-482d-bd1b-e20af8af78c4","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-01T16:07:49.805555Z","title":"arXiv preprint arXiv:2412.14169 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18116","last_updated":"2026-07-20T16:11:19Z","snapshot_observed_at":"2026-08-10T22:04:18.551814Z","submitted_at":"2026-07-20T16:11:19Z","title":"SGA: Plug&Play Geometric Verification for Educational Video Synthesis","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:49.805555Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2607.18116"},"observation_digest":"sha256:b0b651bde4e61f1597ad17880ff2baa1cff5b74684085f3277817c934be26ee4","observation_id":"493494b3-5002-4a39-a219-2cc78267f160","resolution":{"observed_at":"2026-08-01T16:07:49.805555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14169/citation-record","integrity":"/paper/2412.14169/integrity","json":"/paper/2412.14169/citation-record.json","paper":"/paper/2412.14169"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2305.10403","doi":"10.48550/arxiv.2305.10403","metadata_source":"pith","pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM 2 Technical Report","venue":"cs.CL","work_id":"905ee9a7-ea61-4a94-bd62-2600cbe3e315","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:5f6d1202d5ef81503cc442195c5a0fb9a5b4e3deaa8e3d363e5a37cd59605b28","observation_id":"76ac30db-26ed-403f-9540-774f28894fd7","resolution":{"observed_at":"2026-05-17T15:07:39.750148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.07009","doi":"10.48550/arxiv.2408.07009","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen 3","venue":"arXiv (Cornell University)","work_id":"a1dd317f-8300-4a79-a1d0-92ddd93fa983","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:9d8ada33ddb41ad31d0a49e93f0a5efec32b9731fc5023a835c5633aea04da08","observation_id":"f1a46148-ad26-410a-95d2-9700b4f269f4","resolution":{"observed_at":"2026-05-17T15:07:39.755520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:30.169107+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:30.169107+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:f62d0f45522e33eadd7ee6134033b81ed26ec6ff47a9daeea9d3b3e16655b6b5","observation_id":"ba50ecb8-fb95-471d-8cc3-a381649a280b","resolution":{"observed_at":"2026-05-17T15:07:39.760358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:110f2c4ab34bd0b3199fb023eeb344cd80cfac6b5b3fcdef57efec541683bfcf","observation_id":"0d06b667-717c-42bf-bcb0-afba223e2c30","resolution":{"observed_at":"2026-05-17T15:07:39.765826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:38e10a4c89d5312f699c8c85ca9d5f8bcd19280659a7404ce9b7cd24d9a8a905","observation_id":"66e0d9ea-dd01-44ae-baca-dd2d23af5fab","resolution":{"observed_at":"2026-05-17T15:07:39.770391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:ec40b86d8ff4218478c0973743332347151a0be2b7ff9f867e52ac2a1e76fb75","observation_id":"7d57e557-7d78-405d-89fe-b6177df03839","resolution":{"observed_at":"2026-05-17T15:07:39.775119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:c483926d6cc0855fdcfd14cd4eebe7959afb1429126c7c1faec787c4d2d04bd6","observation_id":"19a5f75a-1906-4525-9d36-5a66a2499902","resolution":{"observed_at":"2026-05-17T15:07:39.780066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:58717409259bd043ba32e900f7632cece89605971cf709f0ba24e0b1fdb3bf32","observation_id":"808f4892-2bbc-4654-ae2f-466784efe87a","resolution":{"observed_at":"2026-05-17T15:07:39.785283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:8eb5015f60bcd834f448826c8175c831336a0282a1083fd2bf1ac8347a03412a","observation_id":"b441d8ef-4e23-4bf3-bdad-a6e99cb71ba5","resolution":{"observed_at":"2026-05-17T15:07:39.790517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:b150bafc886772ab0d81d181064941d9eb1130f2c3e66e2ba22124c76a8e0499","observation_id":"6eb5ac61-ff59-4442-a916-68628b2d8529","resolution":{"observed_at":"2026-05-17T15:07:39.797214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:619fd36c6bd3805bc4a0b9b561857349bbd7571696ed7a544661c35956e87afd","observation_id":"d813ed29-913d-45ae-9ba9-1207ee15fd13","resolution":{"observed_at":"2026-05-17T15:07:39.802397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"77f883ba-9acc-47e4-bb00-48c737c2da0e","year":2016},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:da43ea336bb6167cbed4a4edc2f1d90afd16742bb738c5e5d734f143f4080a4a","observation_id":"e05e5b2e-1d99-4845-81d4-a13b7aeb280d","resolution":{"observed_at":"2026-05-17T15:07:39.921188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:061d55affef20a6c326d229720b002806162e3f3f41a908fa567034f10850bce","observation_id":"526fe2fe-c0d8-4dc2-a911-acac4423c6c0","resolution":{"observed_at":"2026-05-17T15:07:39.848021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2402.17245","doi":"10.48550/arxiv.2402.17245","metadata_source":"pith","pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","venue":"cs.CV","work_id":"53c64fda-8566-434d-bc10-2fdfbc6a55ad","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:40ec7e1b7191f41f6127d20ad461af47837ea72345adc0fe46347e65f7e505c8","observation_id":"7abd1a6d-593b-4dc2-bddd-8e0c71fff58f","resolution":{"observed_at":"2026-05-17T15:07:39.853919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:afdc2d4af9580d476d3fe2e685c4eacb816e2df91c233761a5c0b568c6532aca","observation_id":"a64fa0b6-6fba-4423-8591-c0e820380f6f","resolution":{"observed_at":"2026-05-17T15:07:39.859781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:e05067a796fb0406d9f8003e6b301a587b153dc53c8f8396dba85dfd840d256a","observation_id":"51b11311-6f92-4453-8a85-380af600e016","resolution":{"observed_at":"2026-05-17T15:07:39.864263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2108.01073","doi":"10.48550/arxiv.2108.01073","metadata_source":"pith","pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","venue":"cs.CV","work_id":"cfaeaf1f-2560-4505-bcdb-c9aa6cc99d83","year":2021},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:949a5364962219f37e6f5541cdbdc0e99b341c3fe1ee45553760ee927cc9658b","observation_id":"6a6deca0-96af-4a28-8433-c62921ad5f90","resolution":{"observed_at":"2026-05-17T15:07:39.869713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:01.687066+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:01.687066+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09494","last_updated":"2022-05-09T17:02:49Z","snapshot_observed_at":"2026-07-06T12:49:14.981089Z","submitted_at":"2022-03-17T17:48:32Z","title":"Transframer: Arbitrary Frame Prediction with Generative Models","version":3},"cited_work":{"arxiv_id":"2203.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.09494","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transframer: Arbitrary frame prediction with generative models","venue":null,"work_id":"7bf93c42-9a04-4e34-99ea-6e3c74dcbaaf","year":2019},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2203.09494","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:b907f5ed4ab93f34dd37e2b12568a5cae55d15b0f0430ae3b540a0c331ca133c","observation_id":"2140ae52-36a3-45e8-9069-f2ca91432107","resolution":{"observed_at":"2026-05-17T15:07:39.876874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":"2112.10741","doi":"10.48550/arxiv.2112.10741","metadata_source":"pith","pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","venue":"cs.CV","work_id":"34430d19-7919-48ce-88a5-17b3bfe2192e","year":2021},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:99f48568cd5f473588f6d47fb9e7330d496fd7a2c389359d1d2a94a75637e658","observation_id":"90101cbb-03d1-4d0d-ad9e-3f4600f48ca3","resolution":{"observed_at":"2026-05-17T15:07:39.882909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:943c1cc997c3ea160086d749d5dbec5f10b19366b8913a237d6700fb91fb5752","observation_id":"d3e7fe0d-8c7c-4038-a3d1-9c29714185f7","resolution":{"observed_at":"2026-05-17T15:07:39.888848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:8da6354448834bf83bcf54c9faf83d56c7735d7eda72af61d464bbfb0ddcee6a","observation_id":"59847b72-a959-4125-ba4e-ae98b9fc612e","resolution":{"observed_at":"2026-05-17T15:07:39.896283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:1d12c413e86594c651fb492592c198b95575a44e1edc61f31e5c4652be43c077","observation_id":"5d36d21f-3e7a-48e6-8b93-471f14b1a2f1","resolution":{"observed_at":"2026-05-17T15:07:39.902161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:07e58b4b09e296cb0e159865a9f90a5559533a15a2494b0890f44e81950f5eb9","observation_id":"eac14bfc-28e3-48c3-8ac1-5053b2cfc05c","resolution":{"observed_at":"2026-05-17T15:07:39.907061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:874bf340172849222f987003c8a9a90d1019d5e3f3bccb1a13c8a42badf8f956","observation_id":"1c6270e0-1e58-47e8-9950-89e91be7415e","resolution":{"observed_at":"2026-05-17T15:07:39.912883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:bb2448df0807ce06419c4a131efcb09ce202d1c275825fbee8a435fec9837684","observation_id":"ac86e80f-5e89-4fa1-9a3a-120a335acb8f","resolution":{"observed_at":"2026-05-17T15:07:39.917441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:5c9cdc98f562b02a98d7aeb10d00e26849c335c4febeae544e5b3316b2e00c6c","observation_id":"db8a4d00-dc3e-4601-86c0-1f31e894ec11","resolution":{"observed_at":"2026-05-17T15:07:39.810241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:9b95a270a276551a88d5de511ff49aeda89b50cef28cb4808358b6eff6788825","observation_id":"43ecb43a-4735-4712-b75f-d7a2087f9dc3","resolution":{"observed_at":"2026-05-17T15:07:39.816112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:589c599c5079d96826176c8ed26317cdadb86bfcad28ca7b59883570c603fec9","observation_id":"ff83a8d2-cdcd-49d6-806b-3deebe214092","resolution":{"observed_at":"2026-05-17T15:07:39.822727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:1b01dfc4181ae3275452ff1ee5de2eeff64343d25cec26bd99219915beb7ba09","observation_id":"a131a26e-66f1-48e2-a545-bc3cf6dc6b16","resolution":{"observed_at":"2026-05-17T15:07:39.829441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-05T00:59:34.191472Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2309.15818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"2d474f0d-9f50-441f-a8be-68bdb765d647","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:a39a8b69e7072fb6bb3d2657c7a62619755ae0bc915a668eb422b8e90b27d3ad","observation_id":"31424b6a-0733-4bc8-b814-63af7358e723","resolution":{"observed_at":"2026-05-17T15:07:39.836921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":"2406.18583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-07-08T00:04:22.362322Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit","venue":"cs.CV","work_id":"a86301ea-f268-4427-89ff-5d7599f00938","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:3e2ca4c6f24d4c848717286accb2f1af456021c9dee784bc00d562608f69b9e4","observation_id":"6dcbc11a-5b14-4933-8af5-0903233ddb4b","resolution":{"observed_at":"2026-05-17T15:07:39.842642Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Here, more implementation details and ablation experiments are organized as follows: • Architecture details of Scaling and Shift layer (Sec","venue":null,"work_id":"87be1d0b-ba15-4172-8fef-2eb32343d3f1","year":2025},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:fc69583c241ebfdc1c5c708c97c6994400a336b489e7e75b79fe594821350883","observation_id":"bd32df8b-70c8-40e0-ad63-00943cb04283","resolution":{"observed_at":"2026-05-17T15:07:39.938730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UpProjectorDownProjector LayerNormScale, Shift <BOV>outputs Temporal outputs Indicator Tokens Figure 11: Scaling and Shift layer","venue":null,"work_id":"c4766511-bab8-48a4-a15c-4eb2b945f70e","year":2025},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:80d19d008d1f285f4b1de52469edeebba97e91d157110b125b0edbb1dab9687d","observation_id":"66e6bdcd-f00d-4246-acab-b239aa686ccc","resolution":{"observed_at":"2026-05-17T15:07:39.924731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"While NOV A is already efficient in text-to-video generation, there is potential for further acceleration in the spatial layers","venue":null,"work_id":"13c9245e-9f71-4a07-8bd3-cc3bb35223b9","year":2025},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:eb87bcdd8c6b11151335dcdac96def244e1b05e97b7807d1002db0e36c601891","observation_id":"c190cdcf-6a73-432b-9591-74dd12e6d4bc","resolution":{"observed_at":"2026-05-17T15:07:39.928240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This limitation may be attributed to our reliance on extensive web datasets, such as LAION and DataComp","venue":null,"work_id":"9218f244-b03e-4ab6-967c-d75711ebf9cd","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:23ef0fa469a6ce7eb7761160bdd22e69236e873323056283fbcf038b1fdda040","observation_id":"bc11d232-6cc4-48cf-80eb-8f3aea805107","resolution":{"observed_at":"2026-05-17T15:07:39.931696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In the foreground is the detailed, head-and-shoulders portrait of an elderly man with a long white beard","venue":null,"work_id":"a70fe501-9c46-482c-a4fa-3c17619c9d63","year":2025},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:770f12c1423907b0c4cbec603a2b692e4ebad5f4994adf44b46a1f6d09b98072","observation_id":"5480f284-237b-41c8-a924-9253e95f5750","resolution":{"observed_at":"2026-05-17T15:07:39.935042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":6},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 58 inbound Pith citation observations for arXiv:2412.14169."}