{"as_of":"2026-08-06T21:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f30995951c429add658ebf96526009ce64bdb11be71e77dd692406d96f7cff01","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:28:18.785749Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:59:42.126868Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T23:05:17.201790Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2503.19325"},"observation_digest":"sha256:7f0792c798cdfe37c46878591ee6d4bba2224569b2a93a0725ce59de4ad06949","observation_id":"dd22fff3-da1f-4b98-b803-84bfa263a91e","resolution":{"observed_at":"2026-05-16T23:05:17.409270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:53.029590Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2506.08009"},"observation_digest":"sha256:fe0f51c5f76bbf8e095f51bf057f9cb74f2ed6a7fafb588d3d33840824f38b25","observation_id":"6c0d6521-52c3-41c3-ad36-e9ab732fda96","resolution":{"observed_at":"2026-05-11T01:36:53.332342Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T12:09:56.836351Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2506.09113"},"observation_digest":"sha256:c6f7c5742ce71b280aaf88c58903aaa0120576a51786ddb78429378084d9dc5a","observation_id":"f7dcf032-3a38-4c2d-ac4b-43df9576d2bc","resolution":{"observed_at":"2026-05-11T12:09:57.472650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-06T21:28:18.785749Z","title":"Long context tuning for video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00162","last_updated":"2025-06-30T18:11:21Z","snapshot_observed_at":"2026-08-06T21:19:53.808461Z","submitted_at":"2025-06-30T18:11:21Z","title":"FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:28:18.785749Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2507.00162"},"observation_digest":"sha256:80329bb740cc7815674101b2febce2d3692fbb7cb6d9a0885d93ee4bbe732c30","observation_id":"41cc4d12-e0c1-4e9f-a56e-e0932c9f53ad","resolution":{"observed_at":"2026-08-06T21:28:18.785749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-06T16:39:23.564667Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12952","last_updated":"2025-07-17T09:46:43Z","snapshot_observed_at":"2026-08-06T16:31:38.596869Z","submitted_at":"2025-07-17T09:46:43Z","title":"LoViC: Efficient Long Video Generation with Context Compression","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:23.564667Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2507.12952"},"observation_digest":"sha256:5c335018c4674ac4cda457690b7f4315e2301308140cd62eedb376025e71fdfd","observation_id":"02620058-ac81-4ad0-96f2-5e083b777a16","resolution":{"observed_at":"2026-08-06T16:39:23.564667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-06T14:37:19.522905Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18634","last_updated":"2025-07-24T17:59:56Z","snapshot_observed_at":"2026-08-06T14:37:18.436315Z","submitted_at":"2025-07-24T17:59:56Z","title":"Captain Cinema: Towards Short Movie Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:37:19.522905Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2507.18634"},"observation_digest":"sha256:21d0f2a06325a20f6f13ff07ed276bd4f5dcfca28eb8c9fa27ec426f1d5c98aa","observation_id":"42fb464e-0f95-46f8-bc8d-19593f606416","resolution":{"observed_at":"2026-08-06T14:37:19.522905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-05T20:20:21.169944Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-06T09:41:15.308895Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.169944Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:403c8efb8becdaa96729ec8b12c884fe80d8d5fa3c544bc2ca7978807683a548","observation_id":"1cc8a74b-56f0-4691-af30-bc092bd97b36","resolution":{"observed_at":"2026-08-05T20:20:21.169944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-05T20:17:45.932208Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10860","last_updated":"2025-08-14T17:31:18Z","snapshot_observed_at":"2026-08-05T20:17:37.670071Z","submitted_at":"2025-08-14T17:31:18Z","title":"From Black Box to Transparency: Enhancing Automated Interpreting Assessment with Explainable AI in College Classrooms","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:17:45.932208Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2508.10860"},"observation_digest":"sha256:51e2762fc429a42290833417aa45919198668322ccd456ccaaeed1dc2a529bf6","observation_id":"5c5c933a-c49c-4ec7-b88b-ea46b8f5b030","resolution":{"observed_at":"2026-08-05T20:17:45.932208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-15T03:52:59.287555Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2509.22622"},"observation_digest":"sha256:37dd17c283b891eafcab764464dcaf1651427f5ed8fa2ac5efc442aebf9ea703","observation_id":"a546563a-4eeb-49d1-8ed4-2e16c6914f7e","resolution":{"observed_at":"2026-05-15T03:52:59.389278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-16T11:15:29.102090Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2509.25161"},"observation_digest":"sha256:494a2473881ccbf169e774489c47a11f520d810c353291c7becdf5a712364231","observation_id":"fef2babe-f1e1-44b7-b827-d25d7f1ac612","resolution":{"observed_at":"2026-05-16T11:15:29.182969Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-04T10:45:58.380360Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08555","last_updated":"2026-05-27T13:14:12Z","snapshot_observed_at":"2026-08-04T15:58:21.664751Z","submitted_at":"2025-10-09T17:58:59Z","title":"VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:45:58.380360Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2510.08555"},"observation_digest":"sha256:e35ad1bc12c1778aae4fc0a692946a330e14544daeccd6bd29e78be1b6dad047","observation_id":"ae8f9311-cb65-4e1d-bf2e-b5beedf41576","resolution":{"observed_at":"2026-08-04T10:45:58.380360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2511.20714","last_updated":"2026-04-28T23:05:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T01:45:04Z","title":"Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T05:14:36.280155Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2511.20714"},"observation_digest":"sha256:a0f0d50572f51f18a9a56612eb7024627c4a669f0811fe72cf7c15c4eb57f640","observation_id":"d9689b37-09f8-4110-aae7-52c5025e35a6","resolution":{"observed_at":"2026-05-17T05:19:04.994702Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-03T19:41:56.447590Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22973","last_updated":"2026-06-22T15:51:03Z","snapshot_observed_at":"2026-08-03T19:41:54.757475Z","submitted_at":"2025-11-28T08:25:59Z","title":"BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T19:41:56.447590Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2511.22973"},"observation_digest":"sha256:d48c8d878d6c70ab91557aac7089fadeb4714b46c71fb22887e16fe0e06e46a3","observation_id":"1eb05b3e-3471-4a3d-a8bb-9429329417c6","resolution":{"observed_at":"2026-08-03T19:41:56.447590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:ccb9b73b2073d3cdeb0e42a88f81ec5002af525ba3ac91352785521671ce80ef","observation_id":"deebd76c-ea70-4052-b8a0-fd6cc89530be","resolution":{"observed_at":"2026-05-16T18:17:55.154034Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T23:01:13.910539Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2512.09928"},"observation_digest":"sha256:24ed3835daad3fa2cf1c068a24637fb390d9d9f5502423249bbcfbe646538801","observation_id":"a33be3f4-e2c9-4d37-9190-3331c9786a2f","resolution":{"observed_at":"2026-05-16T23:01:20.365367Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-03T15:46:07.570758Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-06T15:52:47.972204Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T15:46:07.570758Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2512.15702"},"observation_digest":"sha256:ef1c0ed98e8ad3128cde5f6128701af0b7ef9d4b988cd7cddbef46a377f4c992","observation_id":"9dd4f7be-ebf0-4929-82f6-4fd78bd08520","resolution":{"observed_at":"2026-08-03T15:46:07.570758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:2be1db7ee6e0847a79a4d7cc26679c69cb929368c1876f98a3bf2f488fa17d12","observation_id":"3ca36f0d-2cba-4e07-ac0b-66ac5cafc9d4","resolution":{"observed_at":"2026-05-16T07:07:29.956398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-02T23:33:09.853077Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.13602","last_updated":"2026-05-30T00:19:02Z","snapshot_observed_at":"2026-08-02T23:33:07.026705Z","submitted_at":"2026-02-14T04:52:11Z","title":"Towards Sparse Video Understanding and Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T23:33:09.853077Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2602.13602"},"observation_digest":"sha256:e9ab3fa6cd7bc1ae9bb060c48aadcf69afb62a4645c9754c495f76cc6f0f30de","observation_id":"c47f3ddb-b99b-4962-a57b-95317005655a","resolution":{"observed_at":"2026-08-02T23:33:09.853077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:66e3076507783ff91da5a0b94933909dd2af8adab4234f513ef199a3c2aca9db","observation_id":"509a244f-c2d5-4f83-971f-afc8e854ec17","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2604.07209","last_updated":"2026-04-13T13:03:18Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:31:22Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:56.588282Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2604.07209"},"observation_digest":"sha256:88990d05e6b5cacf7b93a088d13d4609b2bb3ea737246a606d1343459ba0789b","observation_id":"e384bf9a-0c13-4b1e-bd13-51e1e9142af0","resolution":{"observed_at":"2026-05-10T23:25:53.467071Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:5b814b253ac56e5f7a129aefe83f3ff75b27e8ccce7b4cbe718ff49ab6f5ebb8","observation_id":"d36582f7-8dd8-4c34-8da9-4c92f35ce56e","resolution":{"observed_at":"2026-05-11T11:11:03.849772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":284,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:1cf2b49e654039381cc66a1c93723719caee08f84dcfaad5ca91d87a979bec26","observation_id":"2b2887c9-0918-4e57-a3ca-bfbdf030485a","resolution":{"observed_at":"2026-05-10T09:03:26.131736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2605.14487","last_updated":"2026-05-14T07:27:39Z","snapshot_observed_at":"2026-08-06T04:41:33.559035Z","submitted_at":"2026-05-14T07:27:39Z","title":"Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:48.593354Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2605.14487"},"observation_digest":"sha256:abeac330501a4e562ce852ffe53b74f229096d4dd5d60d8c7e6fe4134bfaa123","observation_id":"3516844a-2748-4f4a-8241-3d94b56d727e","resolution":{"observed_at":"2026-05-15T02:33:32.195452Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2605.23610","last_updated":"2026-05-22T13:20:29Z","snapshot_observed_at":"2026-07-31T18:23:31.169556Z","submitted_at":"2026-05-22T13:20:29Z","title":"EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T04:57:13.479165Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2605.23610"},"observation_digest":"sha256:232f0c97ebf544fc231840fb1ac5ba85af24868c36c052c271f842ac6ec048b6","observation_id":"f29817ed-b14d-4853-a33e-34511bee3852","resolution":{"observed_at":"2026-05-25T05:00:22.344529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2606.07967","last_updated":"2026-06-06T03:50:45Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T03:50:45Z","title":"DisCo: World Models with Discrete Camera Motion Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T20:21:20.257532Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2606.07967"},"observation_digest":"sha256:3cfdb50ce9de73b91b8990934d50639ef9bdeb44bbc224f0d6282fa78d13d005","observation_id":"240f8d65-c023-4d2d-8fb0-7737c9999ac9","resolution":{"observed_at":"2026-07-02T20:37:22.470643Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-02T10:44:02.035539Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:b442772fa997c3b87d1acc8c1e66fb65258d89e758a97581ae1b35e6799605e2","observation_id":"073bfb7a-b621-4518-9f95-be6ef80f2a32","resolution":{"observed_at":"2026-07-04T06:29:36.920808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2606.22370","last_updated":"2026-06-21T07:39:37Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T07:39:37Z","title":"Towards Error-Free Long Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T10:49:36.838492Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2606.22370"},"observation_digest":"sha256:4f45c8bf5eaf37c1261dbc3aad74ba57182c9c7d9a3787a17312c484eb77b2f3","observation_id":"73783787-ea88-47f6-8d8f-7347c2ae93c2","resolution":{"observed_at":"2026-07-04T08:59:42.128260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:2f3a59cd5af5ef7afa452970b3ba341bb3484e9842b0999f8aab32dd8f71701b","observation_id":"6b89e04f-fe3f-4a2c-9f67-ee55b7245510","resolution":{"observed_at":"2026-07-01T10:25:41.893817Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2607.01677","last_updated":"2026-07-02T04:05:17Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:05:17Z","title":"ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-03T16:59:40.925535Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2607.01677"},"observation_digest":"sha256:cd4500d00fc5f843018c0c5dab2e9bb88ff449770430a59cf022fb719582aeac","observation_id":"9226e234-2594-4550-962c-d8c6a3d48efd","resolution":{"observed_at":"2026-07-03T17:08:42.920221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-01T22:25:25.346355Z","title":"Long context tuning for video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15772","last_updated":"2026-07-17T09:03:37Z","snapshot_observed_at":"2026-08-06T18:17:57.399455Z","submitted_at":"2026-07-17T09:03:37Z","title":"SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T22:25:25.346355Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2607.15772"},"observation_digest":"sha256:8bd307d870b646b6df07aa4e8302c584ac0c3dff69fa795bb54d451be318c95a","observation_id":"56ea0048-45e1-42c2-9ff5-40f33b1b0d55","resolution":{"observed_at":"2026-08-01T22:25:25.346355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.10589/citation-record","integrity":"/paper/2503.10589/integrity","json":"/paper/2503.10589/citation-record.json","paper":"/paper/2503.10589"},"outbound":[],"paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2503.10589."}