{"as_of":"2026-08-07T17:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d8d1ce2e5f37f4ce559a672731edb3236884ba1ff92db43e70c436643d06001","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:20.688743Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:59:42.133975Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:5ad37abaeb7ef1446434fa79c29cb8a818fd90356081f44fea7c737784198aee","observation_id":"43ecb43a-4735-4712-b75f-d7a2087f9dc3","resolution":{"observed_at":"2026-05-17T15:07:39.816112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T14:03:20.688743Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-07T13:55:36.207486Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.688743Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:a7e28618347910f8b8aeff4e6d69f64ac7eacc37746785489ecc44541e5ad374","observation_id":"234ef67b-9fed-4f69-b73b-0b10d0e4e238","resolution":{"observed_at":"2026-08-07T14:03:20.688743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T14:00:17.046537Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20288","last_updated":"2025-05-26T17:59:07Z","snapshot_observed_at":"2026-08-07T13:53:18.644320Z","submitted_at":"2025-05-26T17:59:07Z","title":"Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:00:17.046537Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2505.20288"},"observation_digest":"sha256:88dfc8bc52fc991a546589db046c3fc1e8dcf2317da9fbb37316fc9940ce73c1","observation_id":"65cb59c6-2c2e-4798-9077-12b5e9ee947f","resolution":{"observed_at":"2026-08-07T14:00:17.046537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T10:28:41.605178Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-07T11:02:24.060549Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.605178Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:5804fcdaa1376d1edef0d097993f00e8adb5142d342502bf0361f739efafbc0b","observation_id":"ecf31cbd-af7b-4861-b57c-eee64139f826","resolution":{"observed_at":"2026-08-07T10:28:41.605178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:53.029590Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.08009"},"observation_digest":"sha256:0a908843d2046bd1333553c6b61e0211e93329b716693d7bb5d67009e5db448a","observation_id":"4dad1b58-0de1-4a3d-a9d1-2327fcd5b564","resolution":{"observed_at":"2026-05-11T01:36:53.131734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T04:17:51.201816Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models.arXiv preprint arXiv:2410.02757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10962","last_updated":"2025-06-12T17:57:44Z","snapshot_observed_at":"2026-08-07T04:10:38.074752Z","submitted_at":"2025-06-12T17:57:44Z","title":"SpectralAR: Spectral Autoregressive Visual Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:51.201816Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.10962"},"observation_digest":"sha256:6f4001d635896e322478fff6c5528d00f4f6414813b2726bc4b99a2472fb42ca","observation_id":"7e651edd-6035-493a-89c6-4aad685075c8","resolution":{"observed_at":"2026-08-07T04:17:51.201816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T00:30:58.539477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13691","last_updated":"2025-06-16T16:52:52Z","snapshot_observed_at":"2026-08-07T01:28:23.546596Z","submitted_at":"2025-06-16T16:52:52Z","title":"UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:58.539477Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.13691"},"observation_digest":"sha256:bf99404ee1e66376405ac9c1322ac01db3937f5e75050bac4b4bb9833c03938b","observation_id":"f9215a7e-f11a-4acd-a52a-ec5a86ff0863","resolution":{"observed_at":"2026-08-07T00:30:58.539477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T00:30:28.919613Z","title":"Loong: Generating minute-level long videos with autoregressive language models.arXiv preprint arXiv:2410.02757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-08-07T00:15:56.801981Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:28.919613Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.14168"},"observation_digest":"sha256:b5119484acb0f5f4a743ecd594ad26478e667cd9ee1b8291df7983d0b132aa14","observation_id":"7f265ae3-e3f9-4289-ab4c-441826bbe344","resolution":{"observed_at":"2026-08-07T00:30:28.919613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T18:51:29.715057Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-07T10:10:34.633901Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.715057Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:013175ef781427ac0a3ab149cd15a8542496119d6c4ef26e561d752c887a6336","observation_id":"08562ac5-5180-4707-9435-0fbf8578180c","resolution":{"observed_at":"2026-08-06T18:51:29.715057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T15:28:30.643014Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-06T15:22:40.448592Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.643014Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:f9c97631af470a5317260034683424272c466e6764016f7078e214c4dd1d81e1","observation_id":"7f4c72cf-7aea-430b-bf5e-81a1e9075b20","resolution":{"observed_at":"2026-08-06T15:28:30.643014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T14:43:03.279456Z","title":"arXiv preprint arXiv:2410.02757","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.18046","last_updated":"2026-07-29T22:41:51Z","snapshot_observed_at":"2026-08-06T14:37:24.298149Z","submitted_at":"2025-07-24T02:50:26Z","title":"Enhancing Scene Transition Awareness in Video Generation via Post-Training","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:03.279456Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.18046"},"observation_digest":"sha256:c787747eb012987eafb7a517ad9687cea9f3bc74cd0baa012d49ccc10a059773","observation_id":"18149d3f-4904-48fb-97af-b879614ffba6","resolution":{"observed_at":"2026-08-06T14:43:03.279456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-05T20:49:52.758882Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09858","last_updated":"2025-08-13T14:50:19Z","snapshot_observed_at":"2026-08-05T20:49:47.618789Z","submitted_at":"2025-08-13T14:50:19Z","title":"HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:52.758882Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2508.09858"},"observation_digest":"sha256:0a273b22c72e6ca5399ae56fefcb761e3c6790566c2851003b80124318ac8827","observation_id":"e17afe89-c307-4c59-a8a1-eae9de4956e7","resolution":{"observed_at":"2026-08-05T20:49:52.758882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-16T11:15:29.102090Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2509.25161"},"observation_digest":"sha256:9a7a784067218a7c06a9e2135766babc1837192c529c07d8ccc8d263aad8b469","observation_id":"05edc1df-c0f8-4a7c-bebf-b1e5fa8eb76a","resolution":{"observed_at":"2026-05-16T11:15:29.226122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:67dd5707739e472b99ba80071ce4728a32898bea855b748e7d4b27a3e1be2a2a","observation_id":"4965dc40-66e5-46c6-a47e-84b38ec35294","resolution":{"observed_at":"2026-05-18T05:15:54.297371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2511.20714","last_updated":"2026-04-28T23:05:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T01:45:04Z","title":"Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T05:14:36.280155Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2511.20714"},"observation_digest":"sha256:a0492f16e03f37b9c03e28750ef60b75debaa576881bb08726f6b787ebabbd48","observation_id":"6b987e18-a487-43ca-a8c6-39df490ec4bb","resolution":{"observed_at":"2026-05-17T05:19:05.018987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-03T19:41:58.807489Z","title":"Loong: Generating minute-level long videos with autoregressive language models.arXiv preprint arXiv:2410.02757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22973","last_updated":"2026-06-22T15:51:03Z","snapshot_observed_at":"2026-08-03T19:41:54.757475Z","submitted_at":"2025-11-28T08:25:59Z","title":"BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T19:41:58.807489Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2511.22973"},"observation_digest":"sha256:55ba073570c91e54110ce0aae89a4b8152383b6337bc2be9a66bcc016713e999","observation_id":"ff0dd921-4190-4d2d-bbac-46e2f790ad5c","resolution":{"observed_at":"2026-08-03T19:41:58.807489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:4bf0fbb7abf93d3746496ca113bf0b3b4fb688ac8c9a45bb639ad6a3658d1938","observation_id":"ad757ea3-19b1-4a42-b533-57ba00fbb443","resolution":{"observed_at":"2026-05-16T07:07:29.831479Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-07-06T22:47:11.228912Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:ffb4aa7dce03dc5f8e367a92e11c63d7e6c83b70acae9225c8f5170840af1045","observation_id":"4d353ac6-2594-423e-b748-f3962774c70e","resolution":{"observed_at":"2026-05-21T11:40:03.337727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2603.03066","last_updated":"2026-05-19T02:39:43Z","snapshot_observed_at":"2026-07-31T20:59:59.870316Z","submitted_at":"2026-03-03T15:05:27Z","title":"EduVQA: Towards Concept-Aware Assessment of Educational AI-Generated Videos","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T11:52:09.262497Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2603.03066"},"observation_digest":"sha256:ef0f047bf228acddd2789a45c06be7a28ab4b954f057222cbb5ad89df38593ec","observation_id":"db661cb8-0b07-4279-8e00-1d6053650965","resolution":{"observed_at":"2026-05-21T11:54:09.103453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:494c68837bc418d9599b41a82b80da78cf28b5407352b5f8740b68faf5baa040","observation_id":"a5275a79-fece-4cb6-871f-5115c91336d4","resolution":{"observed_at":"2026-05-14T01:38:36.372424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2604.07209","last_updated":"2026-04-13T13:03:18Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:31:22Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:56.588282Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2604.07209"},"observation_digest":"sha256:e3cadada850ff52f31d3900f084e018d4e1f3d97f2673d59b96f3e6fc9267b8a","observation_id":"60e5bb63-2705-4696-9a2a-b466ed02e487","resolution":{"observed_at":"2026-05-10T23:25:53.605274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-08-07T09:57:43.422059Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:8f6f8a6931dc926363c4ea4f561f0f1b7ac3d7a25be5ed5df0794d8537ca4af4","observation_id":"abc3491d-9480-4f38-b430-594dc4f6170b","resolution":{"observed_at":"2026-05-11T23:31:14.905365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2605.14487","last_updated":"2026-05-14T07:27:39Z","snapshot_observed_at":"2026-08-06T04:41:33.559035Z","submitted_at":"2026-05-14T07:27:39Z","title":"Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:48.593354Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2605.14487"},"observation_digest":"sha256:43e19393363acdf5b765fcbbd5654aaa8f4b9df322d3a5bcdb32ccfa0a44ce93","observation_id":"d4980422-aaba-423f-8a2a-c00d56f982f0","resolution":{"observed_at":"2026-05-15T02:33:32.264156Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2605.30519","last_updated":"2026-05-28T19:56:00Z","snapshot_observed_at":"2026-08-02T18:21:57.521920Z","submitted_at":"2026-05-28T19:56:00Z","title":"OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:56:40.001739Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2605.30519"},"observation_digest":"sha256:8901284a9c7392b62716fcab02cbfda0e1fccfdf687e13ffb84ada89147bc460","observation_id":"007b082c-3c63-4872-99d7-ab14f035742e","resolution":{"observed_at":"2026-06-29T08:03:14.485825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-01T15:38:52.805916Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:510407363b059f850e1d95cad9f1f33adf7d76110c08ab5af18025a02086899f","observation_id":"a6dc219e-b016-4691-93c1-1586790ca6a8","resolution":{"observed_at":"2026-07-01T19:16:00.543053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2606.07508","last_updated":"2026-06-05T17:57:32Z","snapshot_observed_at":"2026-08-03T10:42:24.485829Z","submitted_at":"2026-06-05T17:57:32Z","title":"Streaming Video Generation with Streaming Force Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T22:14:32.465663Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2606.07508"},"observation_digest":"sha256:d4aaec02841850e319620380ca43a0d469223d9e5bbdf7a15c2064f8243006b4","observation_id":"e517b4e0-dba0-4f18-a000-163c857f7277","resolution":{"observed_at":"2026-07-02T17:07:12.425890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2606.22370","last_updated":"2026-06-21T07:39:37Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T07:39:37Z","title":"Towards Error-Free Long Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T10:49:36.838492Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2606.22370"},"observation_digest":"sha256:2144c560a996ba0de58516b98a20334e5ccd01640ac731a3e03b66fdaf20c4b3","observation_id":"4339dd7b-7c9d-463d-b2de-e6ea4fb0fd9c","resolution":{"observed_at":"2026-07-04T08:59:42.135414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:dd6aaae1d24bf27bb6ffc8dc2fc5027a4fecf13da6ee07dbb5d2aff8b835e098","observation_id":"7624b5da-d2a8-474a-b6c4-83e8f3175c03","resolution":{"observed_at":"2026-07-01T10:05:40.345090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Loong: Generating minute-level long videos with autoregressive language models.arXiv preprint arXiv:2410.02757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:119daef130792e9cd40fb1aabf5799b474588ee0de298f8bc3e1799ab968bb31","observation_id":"d0ac97ba-c813-4b6a-9385-ec4ecb60ab98","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02757/citation-record","integrity":"/paper/2410.02757/integrity","json":"/paper/2410.02757/citation-record.json","paper":"/paper/2410.02757"},"outbound":[],"paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2410.02757."}