{"as_of":"2026-08-15T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5397bef8f9d28dbda40ef843c5f9d1bc37bf1ca0289de05c73bf7365456090e1","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:11:53.056934Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T13:39:48.225482Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:39:48.369773Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"cited_work":{"arxiv_id":"2412.03758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03758","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6af3fedf-c886-4b9f-ac23-f93231668fed","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2412.03758","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:2f5b9eb565d6fdfeb6d3e0fc1090876cd7a336185070db19ac308b0b404c4e3a","observation_id":"72d6ebc0-f803-40cb-830e-3e6e6ebe8195","resolution":{"observed_at":"2026-05-18T13:39:48.372483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03758/citation-record","integrity":"/paper/2412.03758/integrity","json":"/paper/2412.03758/citation-record.json","paper":"/paper/2412.03758"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.297674Z","title":"4m-21: An any-to-any vision model for tens of tasks and modalities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.297674Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:417807896ea939c2d62d770e27ef3c81b7c88ec15dfbf3f99d42bc92812cee85","observation_id":"5ca0bd72-10b2-4c9b-ad86-bd3be63cb624","resolution":{"observed_at":"2026-08-11T22:11:52.297674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.305995Z","title":"Sequential modeling enables scalable learn- ing for large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.305995Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:1136947e6c20309441029fe1c2787c845c6fbffe0501071e8b7a49fc8c8e5f50","observation_id":"9e947db1-1ad2-4d3d-b071-b06f79762e65","resolution":{"observed_at":"2026-08-11T22:11:52.305995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.312549Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.312549Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:c58eff8316d40d9c5af1ee00cf39d44f611cc1476d0ea01221945655dd17dc26","observation_id":"31befbeb-4b35-434b-b1d1-e235947529eb","resolution":{"observed_at":"2026-08-11T22:11:52.312549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.320069Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.320069Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:39e16ceab219569bf98c684415d20470b3f54c6e8ccf7498be2e9c30f0abfab4","observation_id":"1f506d08-5f11-4717-8f22-93b7a2495b5d","resolution":{"observed_at":"2026-08-11T22:11:52.320069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.328107Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.328107Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:ab5f5364878cef5b6e0c528064384c4d063d2e2a0945fc39cc9cd7993f57fbaf","observation_id":"61762b9d-4ed9-4a66-8d49-9be50bab4b6c","resolution":{"observed_at":"2026-08-11T22:11:52.328107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.340294Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.340294Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:419e4b71f0378c9873e1b1de02ea1d0d08913af5886d7657b8b3c10018f064f7","observation_id":"4cf59159-3bff-4ab0-8344-a1957863856a","resolution":{"observed_at":"2026-08-11T22:11:52.340294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.349287Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.349287Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:35cfa7ffd7080d48cf96344bf5b8e2f2449e98085504a5cbdb7baa71200f3ec7","observation_id":"9a913dc4-cbaa-4a16-a7a5-7dff43bf0af2","resolution":{"observed_at":"2026-08-11T22:11:52.349287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.360824Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.360824Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:b26b9f9803030f202c3b9ffc4eeab2de541e9faae0df5af267f6d7a75058f2dc","observation_id":"010ab84f-bd40-4c1f-92c0-b7f188af3b6d","resolution":{"observed_at":"2026-08-11T22:11:52.360824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-14T16:05:50.720818Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-11T22:11:52.374092Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.374092Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:a790db80eb3bfa26dc3f899335ffa025be3a286ede94c408ae8d7076d653006b","observation_id":"59435cbb-24e8-4fd4-801d-fc2112c07d8c","resolution":{"observed_at":"2026-08-11T22:11:52.374092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.382383Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.382383Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:e17348d45c3d169add59a43058f6363a6b18617325405ddb8aaabb8534f1664a","observation_id":"c9d73ed8-ea3a-4b3c-8899-bd749913039b","resolution":{"observed_at":"2026-08-11T22:11:52.382383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.387557Z","title":"Generative pre- training from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.387557Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:f5fe8ae63c67d1c00dddf2551e71444473c2f955b060d602c50a8f3d6b31aba0","observation_id":"6d2dc819-01cb-4cbe-853b-d702564254de","resolution":{"observed_at":"2026-08-11T22:11:52.387557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.405864Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.405864Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:f2c43642f127260546a1a5d0808cff8affcea70af54877ea5776eb380b61959c","observation_id":"91d892b5-28e9-4cb3-90f4-3172399cde5b","resolution":{"observed_at":"2026-08-11T22:11:52.405864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.414114Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.414114Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:379f3fb3249bb12f24f8ad9c63a333f793e1cf9da9afa18a896aa4ef3d13fca0","observation_id":"3bdfc64c-4c0d-4bc2-87b8-1fcfc78fffae","resolution":{"observed_at":"2026-08-11T22:11:52.414114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.423018Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.423018Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:b908819b41f96cee93fb1e4afb277b569507894d9f7b417584be022843f2fcae","observation_id":"8c3a5c70-61d2-494e-aa1f-6ab3d30426b7","resolution":{"observed_at":"2026-08-11T22:11:52.423018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06424","last_updated":"2025-03-16T03:30:10Z","snapshot_observed_at":"2026-08-12T22:27:45.067980Z","submitted_at":"2024-10-08T23:39:34Z","title":"Restructuring Vector Quantization with the Rotation Trick","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06424","snapshot_observed_at":"2026-08-11T22:11:52.437454Z","title":"Restructuring vector quantization with the rotation trick","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.437454Z"},"links":{"cited_paper":"/paper/2410.06424","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:fccc7ab78b0f9ca37082ae398d94a49e20a457d93ca5b0718de4089b0a1c275c","observation_id":"59a65472-ec2b-4512-a023-4b9d749e5a87","resolution":{"observed_at":"2026-08-11T22:11:52.437454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17398","last_updated":"2024-10-28T05:53:17Z","snapshot_observed_at":"2026-08-14T19:38:35.466522Z","submitted_at":"2024-05-27T17:49:15Z","title":"Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17398","snapshot_observed_at":"2026-08-11T22:11:52.444677Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.444677Z"},"links":{"cited_paper":"/paper/2405.17398","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:ec746c4343b8dac7cc6b3c1eb97a6b616f82b51f4ce42bdb914693b08fcee072","observation_id":"220940eb-0a4b-41a9-bbc9-6effe629c0b6","resolution":{"observed_at":"2026-08-11T22:11:52.444677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.930937Z","title":"Simvp: Simpler yet better video prediction","venue":null,"work_id":"13bf4cbe-243a-4ca2-accf-e41c83747f72","year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.450682Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:99c160162aa5c22728c2470cbbcaf369b94889e1d7935a1156376075fe75a5d8","observation_id":"71366443-ffff-443e-8ee4-2f80e2d9142b","resolution":{"observed_at":"2026-08-11T22:11:54.937035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.912548Z","title":"Worldgpt: Empowering llm as multimodal world model","venue":null,"work_id":"7c0dce4c-044a-4a6b-a39f-8de5425d25c9","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.457671Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:459f7bcf9cbd9a23510ec646a98effa9bfafcc535e177439b5e2a854d00daaee","observation_id":"dfd16095-f421-49c8-b3a9-94e8fe1f87fe","resolution":{"observed_at":"2026-08-11T22:11:54.918504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.887889Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"c15d2bd1-6192-4e19-b92a-eb93c6beaa1c","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.474801Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:5904742a98da8d28e7ca6b2144a3ec269f8ab8d1d3e73a93c1d8c09f5d4203e9","observation_id":"e445c23d-9858-4d3d-988d-a8b201528cdb","resolution":{"observed_at":"2026-08-11T22:11:54.894646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-13T05:04:48.764860Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-11T22:11:52.484101Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.484101Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:31f05357eceb6d6a4c88692aedd579a51dd7cda328114cb6e98c6f975c2f20c3","observation_id":"b124ba76-0c48-474f-b54b-9c607d9288c6","resolution":{"observed_at":"2026-08-11T22:11:52.484101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.866449Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"b39e245d-2703-477f-a3b0-90b6e61e861c","year":2018},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.492422Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:870f9ff3f1be1fbfc0b9d7b4cd73a6b1ba6e8e047251d9fcea243ed443523e00","observation_id":"0efcf9cd-b4bc-4348-9ca6-fd4bed4ff06b","resolution":{"observed_at":"2026-08-11T22:11:54.872614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-11T22:11:52.502368Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.502368Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:9743656109615ca7bbb4611c9cabc4a68b81eaac7a2c94b798fb1d76e1ab0c0a","observation_id":"db28c11b-4964-4825-8e3d-3dac0c8b56ab","resolution":{"observed_at":"2026-08-11T22:11:52.502368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.510644Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.510644Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:c11cbb54d387ce8c36949ba542717f4c1f81a875460377458c2733daed025685","observation_id":"56f010cf-b3cf-4a15-8230-8b9d28715e49","resolution":{"observed_at":"2026-08-11T22:11:52.510644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-13T18:13:05.895663Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-11T22:11:52.518291Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.518291Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:da7001da2575b1b73ab4472a4d1ea98ca939f3cc36ac099e7210026ff607397d","observation_id":"9fe52c10-76d8-4a16-9143-c8f081afe4cb","resolution":{"observed_at":"2026-08-11T22:11:52.518291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-11T22:11:52.524233Z","title":"Gaia-1: A generative world model for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.524233Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:4c1bbc31d667c4206d1a462128cfa6a1895222bc867020d1ab5f595aee35f82b","observation_id":"2169e6cf-dfc4-4a12-a849-2f05c3835ce7","resolution":{"observed_at":"2026-08-11T22:11:52.524233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.830909Z","title":"A dynamic multi-scale voxel flow network for video prediction","venue":null,"work_id":"008d27e1-fb55-4d95-9d4b-67b46211dc4c","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.541876Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:56ffa9f7b42a779b442ef5bcdeb4cb9b59db8c7f8041455ff05bbb074de82d09","observation_id":"3a5c4acf-af3a-46f0-b3f7-b16466cf5001","resolution":{"observed_at":"2026-08-11T22:11:54.839343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19505","last_updated":"2024-12-30T09:08:12Z","snapshot_observed_at":"2026-08-15T16:01:10.895782Z","submitted_at":"2024-12-27T07:44:07Z","title":"DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19505","snapshot_observed_at":"2026-08-11T22:11:52.549073Z","title":"Driving- world: Constructingworld model for autonomous driving via video gpt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.549073Z"},"links":{"cited_paper":"/paper/2412.19505","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:e9e8bf890a3da411e01e85eecfce8943a3ce5ee8bce53416a2395a73a5c93ea8","observation_id":"9acad089-1f21-497d-9a75-b60439efa4ba","resolution":{"observed_at":"2026-08-11T22:11:52.549073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-11T22:11:52.558137Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.558137Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:e6da870c55be88604b8052ba3966ed6ad5e3020b85a9b1f0b049c26e1db1ac89","observation_id":"bc66bf69-6e96-4243-8ffc-252775dee326","resolution":{"observed_at":"2026-08-11T22:11:52.558137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19438","last_updated":"2024-12-26T10:33:31Z","snapshot_observed_at":"2026-08-13T10:07:19.210851Z","submitted_at":"2024-03-28T14:07:13Z","title":"SubjectDrive: Scaling Generative Data in Autonomous Driving via Subject Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19438","snapshot_observed_at":"2026-08-11T22:11:52.567200Z","title":"Subjectdrive: Scaling genera- tive data in autonomous driving via subject control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.567200Z"},"links":{"cited_paper":"/paper/2403.19438","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:69dfe774f776bb304266b5a1cc963701086b81b91738e62dddaa6ef9a3a908f2","observation_id":"b6e9f28e-5bca-4e47-8bfa-838266e33b5d","resolution":{"observed_at":"2026-08-11T22:11:52.567200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.809785Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"a5fddda1-281f-478b-ae2b-cfc16aa5ab9a","year":2019},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.580870Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:76cb5d6baadea461022694552aa72696e3da03d7de6f8e0b3f83808f710f21ba","observation_id":"61d637d6-27b8-4ea2-9a24-08228bf1b978","resolution":{"observed_at":"2026-08-11T22:11:54.814780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.595832Z","title":"Drivegan: Towards a controllable high-quality neural simulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.595832Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:aa695d49877fccb2d588ea64f97f1c0d0b444d47ae290eb42808a650d331fecb","observation_id":"8c0d0e86-7dfa-417d-b201-c0071c70df32","resolution":{"observed_at":"2026-08-11T22:11:52.595832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T22:11:52.605598Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.605598Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:7616605413f76554ce1d0cfd97254bd58408eb14a84139feb0c4975fb368287b","observation_id":"a013a7e9-65ce-4223-b9ac-3592cbda47c0","resolution":{"observed_at":"2026-08-11T22:11:52.605598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.777004Z","title":"Uniformer: Uni- fying convolution and self-attention for visual recognition","venue":null,"work_id":"c488485d-53a9-469c-9c02-dceb5533ac57","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.617290Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:d1790c417f3b100b064964a8822f914187f735b002bd0dbef3dd3c07ac7ae339","observation_id":"166e6dcc-650b-4a0c-b2eb-ff66d72b9ddf","resolution":{"observed_at":"2026-08-11T22:11:54.783133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07771","last_updated":"2023-10-11T18:00:08Z","snapshot_observed_at":"2026-08-13T05:51:53.766455Z","submitted_at":"2023-10-11T18:00:08Z","title":"DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07771","snapshot_observed_at":"2026-08-11T22:11:52.623864Z","title":"Drivingdif- fusion: Layout-guided multi-view driving scene video generation with latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.623864Z"},"links":{"cited_paper":"/paper/2310.07771","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:7bf7c5ffff195c14a62b729bb3b4478b8293cd780513b067415bee282a0cf133","observation_id":"a0fc5fd5-fcb8-4acf-a030-ba2158849880","resolution":{"observed_at":"2026-08-11T22:11:52.623864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-11T22:11:52.631572Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.631572Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:530580c5468e89d5806f477ee0a607d288ad2af454eb65aa063aa098c3f69631","observation_id":"f6e91049-1e55-4efd-b715-1b5b4d001bf4","resolution":{"observed_at":"2026-08-11T22:11:52.631572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.751432Z","title":"Video frame synthesis using deep voxel flow","venue":null,"work_id":"94bca343-2646-4e60-87a3-b9af62eea8af","year":2017},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.639594Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:95769cf3a2159b88cbed0572af390d52c57cf002f8e2e74fd9ab5eaca87695d9","observation_id":"b941f491-f909-4c8a-981d-78383969674f","resolution":{"observed_at":"2026-08-11T22:11:54.758689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.732010Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":"2583a1da-c024-42bb-a74c-4da3a02f2227","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.654428Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:1d09631359873979f338321ce7b0fe93e71ddeb167c2b05cb132d37ada2d097a","observation_id":"e8f5b1d6-03ca-43bb-bde2-bd06d94cbc77","resolution":{"observed_at":"2026-08-11T22:11:54.738155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.713084Z","title":"Wovogen: World volume-aware diffusion for con- trollable multi-camera driving scene generation","venue":null,"work_id":"41282faa-2f52-4735-9b04-cdb1d5a4584f","year":2025},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.660691Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:1861ebaf141956358526a24ca8a683563fe4766fbccc64140f8bd642b3bdc3f6","observation_id":"be619297-449c-4bae-803a-08a87feded31","resolution":{"observed_at":"2026-08-11T22:11:54.719005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.695077Z","title":"Masa-sr: Matching acceleration and spatial adaptation for reference-based image super-resolution","venue":null,"work_id":"b58ccbcb-f79b-45c0-8dc4-cc6687af4a2d","year":2021},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.668555Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:13fc527addac078b0b78a2059691cbe221ab83bbd938ece59d715f807c0fbd0f","observation_id":"4a7dd1c6-ebd6-44a8-a51b-29eedd3a59fd","resolution":{"observed_at":"2026-08-11T22:11:54.701181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08320","last_updated":"2023-10-13T01:43:04Z","snapshot_observed_at":"2026-08-13T12:24:29.098697Z","submitted_at":"2023-03-15T02:16:39Z","title":"VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08320","snapshot_observed_at":"2026-08-11T22:11:52.676730Z","title":"Videofusion: Decomposed diffusion mod- els for high-quality video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.676730Z"},"links":{"cited_paper":"/paper/2303.08320","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:8b90cb89f78eb87ba9211cfbc98be7f71585caf5a89506f1c0fa986e92f37a8b","observation_id":"e18c1ab8-b42a-4b92-b71e-076cb7290abe","resolution":{"observed_at":"2026-08-11T22:11:52.676730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-14T02:43:25.975990Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-11T22:11:52.684577Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.684577Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:06c993a926abeaa6434191dbacdb3fe83c1fa6ecf0b177b77ffba26462054bc0","observation_id":"81c6410c-c77a-4556-aead-686ffd165184","resolution":{"observed_at":"2026-08-11T22:11:52.684577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14718","last_updated":"2025-07-14T09:44:08Z","snapshot_observed_at":"2026-08-13T04:34:14.739910Z","submitted_at":"2024-01-26T08:59:38Z","title":"A Survey on Future Frame Synthesis: Bridging Deterministic and Generative Approaches","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14718","snapshot_observed_at":"2026-08-11T22:11:52.700387Z","title":"A survey on video prediction: From deterministic to generative approaches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.700387Z"},"links":{"cited_paper":"/paper/2401.14718","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:ca5b02ff60eaf35ff04b1e43f33a75cbffc254026678d9422f351be4a1ec40f7","observation_id":"9088f5d0-dca2-45db-8211-2d57682a1602","resolution":{"observed_at":"2026-08-11T22:11:52.700387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.676130Z","title":"4m: Massively multimodal masked modeling","venue":null,"work_id":"21992cf2-f5b1-4ae9-af8f-2a4026336e67","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.707093Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:79ca6f68d3f4b8bc5cb79d7df4ec308b96d9a26f2ce349d0c97290eee7877668","observation_id":"4d50a6da-060d-485c-a502-b4c4407616d5","resolution":{"observed_at":"2026-08-11T22:11:54.682921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.653679Z","title":"A review on deep learning techniques for video prediction","venue":null,"work_id":"b00ff5f0-4230-448f-9c6a-a741516939bb","year":2020},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.714701Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:18d547736c0ddce0dba6bc2eea67489c249dd48b87b89b69ff34b0feb8b925d7","observation_id":"ec682287-68c2-4a2d-871c-3ea251d598b7","resolution":{"observed_at":"2026-08-11T22:11:54.659454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.635706Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":"9da7133e-21ec-42a0-bcf6-2cf34d8f3da5","year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.723354Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:83b751e3a1bd01122baba01acda85f38386a83cd1820b6052c08540251fbd203","observation_id":"0376c388-34c1-46f2-96e1-f57eb5b4fd79","resolution":{"observed_at":"2026-08-11T22:11:54.641719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.731052Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.731052Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:8948f7970b525e1ac353d4e1e6fe033e78e73bea9c56bda85538c35a1018c8df","observation_id":"9a21298a-3ac2-4870-82fe-0f3903b17733","resolution":{"observed_at":"2026-08-11T22:11:52.731052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T22:11:52.736838Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.736838Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:232099ff77af277bd340e6fe1776ba38b15a5271ebb5e3afd8f80512841a816f","observation_id":"387405a6-6961-4e37-93ee-cf01d3337e85","resolution":{"observed_at":"2026-08-11T22:11:52.736838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.742098Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.742098Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:b03d91f258cc3ce8b2efcf236c451a92b30044e91fe106f44921d01ab0c40f97","observation_id":"f2d64baf-3c1d-4ac9-a43d-998b13696700","resolution":{"observed_at":"2026-08-11T22:11:52.742098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.749873Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.749873Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:ad16247904a24ccc2e775425c1119308d2cd0d1e8e10513bf68ec6d47333e8e8","observation_id":"86b41685-ca24-4e5a-8347-92e04007008a","resolution":{"observed_at":"2026-08-11T22:11:52.749873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.755863Z","title":"Gen- erating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.755863Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:76f54922dc48ecbdc19e328ad6ef1ac3f8d78bf0976b0f80c0869d5c1465df7a","observation_id":"91fe2c47-21cc-4c6b-85d2-13b1e42c3cec","resolution":{"observed_at":"2026-08-11T22:11:52.755863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.761573Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.761573Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:801214abbddefab6ce4bc9e6cce552a119b5addb5e517f47361ef7519c4fbce2","observation_id":"f833eb71-60a7-43a4-b0b7-1fb6dd4da5ba","resolution":{"observed_at":"2026-08-11T22:11:52.761573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-11T22:11:52.768454Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.768454Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:ea9c778dc5d34c6143768eadd19b925cf0af639defb7a060b0068cad3bfc83b9","observation_id":"45c0fdc8-1700-4991-99ee-3e81c1b30df3","resolution":{"observed_at":"2026-08-11T22:11:52.768454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.549714Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"8940dad0-02b7-478a-b087-3d3214980f33","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.774341Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:19939f110c7e4829499c1893435dc834412a06a484917e01f973e1a8911d9ad6","observation_id":"432f6f19-dbe9-4d43-9392-c7f7c167daa0","resolution":{"observed_at":"2026-08-11T22:11:54.556717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.779648Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.779648Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:e2cde38f95d0f5d620ff8871d55ffd8fcc0a954a90441557ee8506c7baccca63","observation_id":"72a91f2a-6f3f-45f1-85ac-e556f1ffec2d","resolution":{"observed_at":"2026-08-11T22:11:52.779648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-12T22:23:26.382002Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-11T22:11:52.786214Z","title":"Hart: Efficient visual generation with hybrid au- toregressive transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.786214Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:6132a7a1e0150b964c3bc7ed88c3d74f5a59a6fcc8151ace5678d47ef4740b72","observation_id":"d3f95508-5abb-4f43-9241-174b7b59b373","resolution":{"observed_at":"2026-08-11T22:11:52.786214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T22:11:52.795799Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.795799Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:cb6654837ac3a3238ba56f97248739ab529959e8ffafa0e4ae95d464721f0ada","observation_id":"06f97568-33f6-4f54-918c-bbe14c87f65b","resolution":{"observed_at":"2026-08-11T22:11:52.795799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.806232Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.806232Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:54cc97d45fa62d5feb18c5412d78963f2f56af4aed162932c3736120fcbfc3ef","observation_id":"4ae9bebc-c9d0-4e2c-ad21-16b3724a10fd","resolution":{"observed_at":"2026-08-11T22:11:52.806232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-13T06:27:06.478433Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-11T22:11:52.814236Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.814236Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:a94bd33e11bb32ec7a1fda6a1ec22ec880392ea2fe24d5292b2b32f39f96db90","observation_id":"9f863bbd-ef95-49b8-a71c-3976eab1d981","resolution":{"observed_at":"2026-08-11T22:11:52.814236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T22:11:52.821530Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.821530Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:93402de35cb4cc1ffacf969c1f1b22c1e8651ec6a30e8850f866f7bfc44db29f","observation_id":"a2ad54c0-dac9-4aa3-9ef8-89c5adbcd3f2","resolution":{"observed_at":"2026-08-11T22:11:52.821530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T22:11:52.828747Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.828747Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:19b96e46d594dcea6b0125608cd7f6deb3fb5914ba76860041712c758b3b9753","observation_id":"3134ff7a-5747-4adb-9dbb-0cce5ab31776","resolution":{"observed_at":"2026-08-11T22:11:52.828747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-11T22:11:52.838508Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.838508Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:4c138263b5ddf26fe391ac05699579031c855004a5e67316e5b71a9281868237","observation_id":"0ad0e2a8-cb1d-4646-b66b-af36bc7e301b","resolution":{"observed_at":"2026-08-11T22:11:52.838508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.496670Z","title":"Neural discrete representation learning","venue":null,"work_id":"6ccd3fc0-31a0-4588-9970-9c4dafb47ac3","year":2017},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.844350Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:55a58f7ef37eb7e6318aae530acb8132e939d1ab6b06bf7ad869c9844e3b7719","observation_id":"ebb31694-1b4e-4ec6-98d8-dc36c9b489a5","resolution":{"observed_at":"2026-08-11T22:11:54.502833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.476951Z","title":"Attention is all you need","venue":null,"work_id":"842c47c8-acfc-4ef3-a3ec-afcb108dbcd2","year":2017},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.850145Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:90e1a5999e1fe8ab626d20dc425fe6ae33227d35b92e190ee01f2ab90637122c","observation_id":"5dae021c-4081-4c80-a806-e87ef27af093","resolution":{"observed_at":"2026-08-11T22:11:54.482705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.450899Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"eb4febbc-d83c-47a9-bd42-bc1703e49624","year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.859288Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:c453ace64348503e3208c439d4e27eec2a9ec5f073d1f52afe2992eb850602c1","observation_id":"b2524ef3-cb1c-41f2-ae34-6cfbcf6e7f82","resolution":{"observed_at":"2026-08-11T22:11:54.460023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.427601Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":"5e5691de-6cec-4729-a02a-d31e4944aecf","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.870981Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:251dec70b841851ddd47701947f7438c6c1af00889f82307d7f734932aa2ace0","observation_id":"f7ef387e-09e9-4216-a172-44d5f050b649","resolution":{"observed_at":"2026-08-11T22:11:54.433568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.404824Z","title":"Seggpt: Towards seg- menting everything in context","venue":null,"work_id":"565590e7-0529-44f3-910f-fe5cfcfb201c","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.880052Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:11b1b8a504d0b2079b1c290312b87432741f8540dfd31f2f980d48c0a57c0251","observation_id":"bbd0dc0f-4b8a-4ba5-a6eb-025be1336b39","resolution":{"observed_at":"2026-08-11T22:11:54.411342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09777","last_updated":"2023-11-27T05:09:29Z","snapshot_observed_at":"2026-08-13T10:10:52.493348Z","submitted_at":"2023-09-18T13:58:42Z","title":"DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09777","snapshot_observed_at":"2026-08-11T22:11:52.887583Z","title":"Drivedreamer: Towards real-world- driven world models for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.887583Z"},"links":{"cited_paper":"/paper/2309.09777","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:15026869a0e21144fccf282b0f8da246d3e32a9261b98d909d2153d3d3eadb59","observation_id":"bbe938da-b11d-4d50-9499-f02f52d11f18","resolution":{"observed_at":"2026-08-11T22:11:52.887583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T22:11:52.894742Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.894742Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:4893f48e429b095ca0b1c497307f9a2c80c40199ff08f79e30b006e0aab0cafe","observation_id":"b25c7dc0-b0de-4c3f-86ac-43360c96536d","resolution":{"observed_at":"2026-08-11T22:11:52.894742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T22:11:52.903306Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.903306Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:4dca60c6103378dbdf24203e12860b8ddf6511d0b9203a13e21c9979a40b9c6c","observation_id":"93b6d96f-b5d6-4e76-836a-478f3bef1e7e","resolution":{"observed_at":"2026-08-11T22:11:52.903306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.384804Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for au- tonomous driving","venue":null,"work_id":"7790d8fa-df58-4958-b8ec-b573c6461905","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.910993Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:b27a5c5942bb7b3827ffa04b0f9b82aff40ad9ee8e780403a4a224c49ce9036a","observation_id":"c1f1047c-6953-4c04-a97b-2443903b5a73","resolution":{"observed_at":"2026-08-11T22:11:54.390480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-13T00:47:41.087976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-11T22:11:52.916995Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.916995Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:829f685d85fcb562ae404b75f810e50188cde3e3c3a50aebe5bf5da60358f015","observation_id":"0353e3cb-5f5d-43f8-800c-3a15b953a808","resolution":{"observed_at":"2026-08-11T22:11:52.916995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-12T22:31:22.501227Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-11T22:11:52.923496Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.923496Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:a2fab8460cf334e4168f19dc75190dbbb791f76f130166bebe5340552f75737d","observation_id":"f3383fad-0396-41ba-885f-78bf3f574bc7","resolution":{"observed_at":"2026-08-11T22:11:52.923496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.363859Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":"5a8c462a-27fb-41db-8d0b-efef242882fc","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.930253Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:9e77289478179cfe704e3d66042551ba8641052e97b8d98becac8aea277f8530","observation_id":"d5edc8c8-6d9d-4a9a-bb1d-5a4912036a76","resolution":{"observed_at":"2026-08-11T22:11:54.369075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.345674Z","title":"Motionrnn: A flexible model for video prediction with spacetime-varying motions","venue":null,"work_id":"bd85d5ef-94c1-4a0a-836e-8359419dafe5","year":2021},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.937202Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:f17714902b6cebcb4718099a6fb92899b41183d20d01d4d5c03e433740a52612","observation_id":"01d54d45-0ad7-40c0-ae53-ce0738ec8867","resolution":{"observed_at":"2026-08-11T22:11:54.351544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.327798Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"75b3c6c7-1ba5-4393-9f4b-42477d5be26b","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.944964Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:663916ed20614618182bb2beac769b00428e1b96ac23ecdfbbfbdc1fd9469e3e","observation_id":"474787cb-7397-45d6-8fb9-952af983f087","resolution":{"observed_at":"2026-08-11T22:11:54.333880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.306836Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"9a4a4df7-7b5d-4baa-ac8f-bf87735fdab7","year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.955613Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:9d5ff18e264059bb6a6918ce1ed05242070a528f7f685f7e41a7203fe5f1bb08","observation_id":"8785395c-1dd5-455d-859f-91a2c49d1ece","resolution":{"observed_at":"2026-08-11T22:11:54.312868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:52.961351Z","title":"A survey on video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.961351Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:8cb2f07c66721a2ec37e7b1050bac6cf3843c8b5b8fdb42391fa687d38952695","observation_id":"cb7a6224-dec5-4a3c-a09c-fdc8f3267fa7","resolution":{"observed_at":"2026-08-11T22:11:52.961351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T22:11:52.966047Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.966047Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:94c7622d7f815a05b80d4b08e121f263b166f8c92257d41972e06ab7d9c82414","observation_id":"1f542c90-edc6-4cd2-a530-3631946b29a8","resolution":{"observed_at":"2026-08-11T22:11:52.966047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.275540Z","title":"Generalized predictive model for autonomous driving","venue":null,"work_id":"502a6a0e-07a1-42da-9886-f951e5d6250c","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.971281Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:34dfd87a813b7f03c7c2cedbf397ceabe0dfcaa1d4cca5a737f4f9153086c0bb","observation_id":"3fd68668-8fc2-4a1a-8249-076c5c3ac68a","resolution":{"observed_at":"2026-08-11T22:11:54.283229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00908","last_updated":"2024-06-03T00:31:13Z","snapshot_observed_at":"2026-08-12T23:52:01.329968Z","submitted_at":"2024-06-03T00:31:13Z","title":"ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00908","snapshot_observed_at":"2026-08-11T22:11:52.975570Z","title":"Zerosmooth: Training-free diffuser adapta- tion for high frame rate video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.975570Z"},"links":{"cited_paper":"/paper/2406.00908","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:d6c61419b5525f88b8a3004331938c99c22e8065f73a1d84f5604f7c745f0138","observation_id":"3fa20282-9e5c-49e4-a080-8d698d887d38","resolution":{"observed_at":"2026-08-11T22:11:52.975570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T22:11:52.981361Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.981361Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:469e8cd4158674ab56acb223205e28b7cb9a53d084c62b1464104897f2d85492","observation_id":"93e4470a-d5db-42e7-b682-40b085b4382f","resolution":{"observed_at":"2026-08-11T22:11:52.981361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04671","last_updated":"2024-10-07T00:55:42Z","snapshot_observed_at":"2026-08-14T21:49:10.362401Z","submitted_at":"2024-10-07T00:55:42Z","title":"CAR: Controllable Autoregressive Modeling for Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04671","snapshot_observed_at":"2026-08-11T22:11:52.986030Z","title":"Car: Controllable autoregressive modeling for visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.986030Z"},"links":{"cited_paper":"/paper/2410.04671","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:a47307b46722f78b5c2f6a5dfff94fa8fc56aa40ecc96fdda45ce5bc05fd4596","observation_id":"2681ddb4-6280-4c1c-a05c-566d7c7f3e4e","resolution":{"observed_at":"2026-08-11T22:11:52.986030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.254291Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning","venue":null,"work_id":"31d49025-6664-4b4c-8a40-6ffe1f71f864","year":2020},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.991086Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:fd7038ed68bbba356e5cd068433cffe78da1189a0bbbaec20f6d56123026d492","observation_id":"99935dfd-3834-4960-97ab-c6efc4be1713","resolution":{"observed_at":"2026-08-11T22:11:54.261141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.235549Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"41aa2395-3134-4420-8e48-7d5c076ccc72","year":2023},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.996962Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:ccbbb8dafb6477e180b1db6140cc0a9fd6bf2a5e7b4d5861077832f707f0c42b","observation_id":"a66a9b79-569b-4714-b037-b236bf54604b","resolution":{"observed_at":"2026-08-11T22:11:54.241365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.218900Z","title":"Language model beats diffusion - tokenizer is key to visual generation","venue":null,"work_id":"e3d4bad0-3f15-443a-a69d-9307587fc925","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:53.002593Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:30203d64b72aa6d217e778e06e0a8b29f11741160b5a986ff77a28abfcf32b85","observation_id":"e78a231d-688f-4d03-b621-7172f3bf7ca3","resolution":{"observed_at":"2026-08-11T22:11:54.223917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:53.009061Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:53.009061Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:98529cca45774ed25dc182fa1489e5a6d6767529f9b2e5fbc51804ce5298d932","observation_id":"0853c036-e229-4b1d-ba9e-698b9183813e","resolution":{"observed_at":"2026-08-11T22:11:53.009061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06845","last_updated":"2024-04-11T04:17:13Z","snapshot_observed_at":"2026-08-14T02:05:47.259643Z","submitted_at":"2024-03-11T16:03:35Z","title":"DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06845","snapshot_observed_at":"2026-08-11T22:11:53.030836Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:53.030836Z"},"links":{"cited_paper":"/paper/2403.06845","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:a45573300157d2a8d5b0b2044a1f3920f0734b1db81f723f0ee8f44b4cb2100b","observation_id":"0a71ca33-a143-4d94-8ea9-a019105aec49","resolution":{"observed_at":"2026-08-11T22:11:53.030836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-14T02:44:15.496372Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-08-11T22:11:53.036778Z","title":"Image and video tokenization with binary spherical quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:53.036778Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:ba0d42e08c68d46c40a12654c5b3c619ae21879269bc871fa822d7691d143399","observation_id":"cc635933-a5f7-40e7-afa8-d2599f9f151d","resolution":{"observed_at":"2026-08-11T22:11:53.036778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.186285Z","title":"Movq: Modulating quantized vectors for high- fidelity image generation","venue":null,"work_id":"95b9c0c3-3df6-400c-9c60-ac9f2381c3f0","year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:53.043221Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:7c66d08336f6b4d6d17cd3f2ad6a6e5e8b0b94f30f3522685ad9222e7d998e52","observation_id":"49cce8df-535f-4631-b10f-2d6b423952ab","resolution":{"observed_at":"2026-08-11T22:11:54.192254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.156868Z","title":"Crossnet: An end-to-end reference-based super reso- lution network using cross-scale warping","venue":null,"work_id":"08609c7b-6054-423f-9372-f0160893f615","year":2018},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:53.051276Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:59b2e06eaf6678362a3491f27b523e87a3f2824e982a100584ddacccfcea7173","observation_id":"f4beb73a-b1fd-4991-adc4-d3ec2691415f","resolution":{"observed_at":"2026-08-11T22:11:54.165996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:11:54.126877Z","title":"Unicode: Learning a unified codebook for multimodal large language models","venue":null,"work_id":"cd33db6a-0b3b-455b-b2fe-091c3268bd95","year":2024},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:53.056934Z"},"links":{"citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:34ee01f33bd53471db1b0187fa18a60e19c54dc77c2fbf3a59dc5b88c2cf91c5","observation_id":"31913af0-2f91-4319-9aca-d64d0373afba","resolution":{"observed_at":"2026-08-11T22:11:54.134840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T09:02:57.065909Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 1 inbound Pith citation observation for arXiv:2412.03758."}