{"as_of":"2026-08-18T17:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b842db3fdc2d60ab8d11ded34213731b704bf59af2545b80ceccc2f21c293c9","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:28:41.932618Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:35:28.291452Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02553","snapshot_observed_at":"2026-08-01T06:35:28.291452Z","title":"Longlive-rag: A general retrieval- augmented framework for long video generation.arXiv preprint arXiv:2606.02553,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21848","last_updated":"2026-07-27T16:34:17Z","snapshot_observed_at":"2026-08-18T07:57:55.808791Z","submitted_at":"2026-07-23T22:33:52Z","title":"Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T06:35:28.291452Z"},"links":{"cited_paper":"/paper/2606.02553","citing_paper":"/paper/2607.21848"},"observation_digest":"sha256:376b755eb3959363f6addf1bacc5c66af234c12e49f9b3faf264d3c12dd8899b","observation_id":"b2054105-0632-461d-bee1-95985a34c4b3","resolution":{"observed_at":"2026-08-01T06:35:28.291452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.02553/citation-record","integrity":"/paper/2606.02553/integrity","json":"/paper/2606.02553/citation-record.json","paper":"/paper/2606.02553"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"NTK-aware scaled RoPE allows LLaMA models to have extended (8k+) context size without any fine-tuning and minimal perplexity degradation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:fbe4ff4f2ffa14dab4a36d168ab653e68c4329d5475a4af9f36650014f00394b","observation_id":"3d3e6021-0c23-4f91-8bf0-f9f35ddba501","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:d31d7c30a3f871e327248527fe455547aeeb644ccf5057f6374f648c7c8dd63e","observation_id":"52cef658-7141-48ba-a31a-9363fe5139e3","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:9a3ed08220bbcacd1eb2d7a828bcc9dba69f6d1e9ce27890befb3534cf825c0d","observation_id":"4412d5ee-a293-44b4-8a01-e3d117fd5cfc","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:fc7101bf4de199a97af8937ba062cc61fcaee4b21f7edbb1f32db5b1ee2bcdfb","observation_id":"76ea7b2d-061b-447e-bd57-a1417574e2c7","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:af7bb30643c6b6927fcf7fbf322da9a5947dced70224107d90022fa165b27567","observation_id":"7bbd7cae-0640-4113-a4e8-50ab58f39703","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-08-15T13:01:37.943884Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":"2504.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-10T01:46:41.058772Z","title":"SkyReels-V2: Infinite-length Film Generative Model","venue":"cs.CV","work_id":"2ce11350-273e-4f0d-ae78-292aa3151060","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:1034096192fde494ece9febabc2acf7c9740fabbce8d7d6860611892393edb29","observation_id":"07076cc2-4a57-4e48-8476-9e6888ff34b5","resolution":{"observed_at":"2026-07-01T22:16:17.141108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":"2306.15595","doi":"10.48550/arxiv.2306.15595","metadata_source":"pith","pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","venue":"cs.CL","work_id":"c8b6df85-e7da-4bd8-90a4-d309cc2a0f60","year":2023},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:c22847603cf525164c65d84d17e5e0d294e8544b83a78085dcbc97f9aaf7b3fb","observation_id":"c12d6cb9-f039-43f5-9eda-743bf8870a06","resolution":{"observed_at":"2026-07-01T22:16:17.144791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:14.561303+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:14.561303+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06028","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.229367Z","title":"Context forcing: Consistent autoregressive video generation with long context","venue":null,"work_id":"55b1729b-5b50-4da3-bd29-c6235903ff0d","year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:fcc32454c8209a8ca3769cbb780891a23c00dbaf4ffdd21d4fec11bcbb019790","observation_id":"3205c2f5-0cf2-4cab-b2b1-3d622b880925","resolution":{"observed_at":"2026-07-01T22:16:17.147844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-13T04:00:21.942422Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2510.02283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-07-08T13:14:53.231711Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","venue":"cs.CV","work_id":"3b83d5f5-6929-46ae-9de2-7c32af3c7346","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:c148cafe6da4ed94017134dda1858b98d122a5fbc5ac03e62f5459508f20739a","observation_id":"d6ee7a8c-6af2-47d1-b308-2b9414b02590","resolution":{"observed_at":"2026-07-01T22:16:17.112255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16914","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:27:02.503868Z","title":"Lol: Longer than longer, scaling video generation to hour.arXiv preprint arXiv:2601.16914","venue":null,"work_id":"a78a2848-7aa5-4af3-aa35-9ace2d8d78af","year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:81fe6f87bdc2b1c24355a1c188c508ba9eeaa21978af628f3f1875d3be517d77","observation_id":"2c77241c-8e69-4b63-9549-a658a2a1131a","resolution":{"observed_at":"2026-07-01T22:16:17.132815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:962d548f305690f9f297d697791f774e2fd077ecf8a3ffe7dfe9bb8c910cf653","observation_id":"63f6e92c-5a0d-438d-86e3-736a7e07ff96","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"A survey on long-video storytelling generation: architectures, consistency, and cinematic quality","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:197c957fc791cf3482700c61c3636cdfb514184f8d0b957ab6ec4e3701302206","observation_id":"6bc5b93e-9961-4329-8318-a48907e7f88f","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03568","last_updated":"2024-12-04T18:59:05Z","snapshot_observed_at":"2026-08-17T08:30:58.061060Z","submitted_at":"2024-12-04T18:59:05Z","title":"The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control","version":1},"cited_work":{"arxiv_id":"2412.03568","doi":"10.48550/arxiv.2412.03568","metadata_source":"pith","pith_arxiv_id":"2412.03568","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The matrix: Infinite-horizon world generation with real-time moving control","venue":"cs.AI","work_id":"11e7c591-d2c5-4d62-9b5e-f9078c35db2e","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2412.03568","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:914075739a09dc6340f4869ee8c3a02892f0fcdd3a2b7d071e90eb988c0a636c","observation_id":"80489691-48f7-4535-9150-2cfa8890d3d0","resolution":{"observed_at":"2026-07-01T22:16:17.079292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00979","last_updated":"2025-06-07T14:03:06Z","snapshot_observed_at":"2026-08-16T12:53:49.315396Z","submitted_at":"2025-03-02T18:12:50Z","title":"Dialogue Without Limits: Constant-Sized KV Caches for Extended Responses in LLMs","version":2},"cited_work":{"arxiv_id":"2503.00979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00979","snapshot_observed_at":"2026-07-01T22:16:17.068571Z","title":"Dialogue without limits: Constant-sized kv caches for extended responses in llms","venue":null,"work_id":"dec93b5c-4c9d-4d18-9ef7-92dc72ce09b9","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2503.00979","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:6a3b747950f4daa19811f46dd0611801109a5a73ac7243a9c594d223415026b9","observation_id":"9852cca9-1e72-4c2e-9bd8-d7e2439428a6","resolution":{"observed_at":"2026-07-01T22:16:17.070425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Gemini 3.1 pro model card, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e2c732bae142b35b11d51f1d589a6df9adb43fc3dbef9f0b20cd1f6abbaf32d3","observation_id":"69451008-e05a-44aa-b6e4-64710dfa609b","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-08-15T15:00:19.916941Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:794a07d50a7e8f680c51ec7cbcc4729c0e29a72e2a392e2a8b0d3a2c70d0211e","observation_id":"b86baa7d-8b24-40cf-836f-e677c69f7aab","resolution":{"observed_at":"2026-07-01T22:16:17.143850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"REALM: Retrieval-augmented language model pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:9c7089bd7a043babcfeb71042e8a7f52aa31622d5bd9ba903c6ede406c4c9e4e","observation_id":"0e41924a-6680-4a59-8de1-c1b2933ecd42","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:a8e5cabe3ba458d6c408a2fa1d2ab1690523e8473aac6c16019139c3ce59fed8","observation_id":"bed88766-d6ee-4a3c-b263-17da861abe62","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.566418Z","title":"Relic: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040","venue":null,"work_id":"d398db79-a718-4fff-a215-641fd1af997a","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:375cc55aeae627fe4641c2dd4dbd3c81f148209ae3ab41ce7b8ffd972c60fe8c","observation_id":"195c101d-8c9a-46cf-8d6b-0d52246c9c65","resolution":{"observed_at":"2026-07-01T22:16:17.138502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2309.17080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-10T11:47:02.949785Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"313484e6-a442-4522-8e19-d07e502844a8","year":2023},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:6733ccc24dfb25fa5cf1e29c59f15d9df07ae646b6d8f635d54cdf2073976c3b","observation_id":"b3b6776d-c386-40f6-858e-b8a00ba7ef8f","resolution":{"observed_at":"2026-07-01T22:16:17.073565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:00a98a77b5cace6e9cceed463cc8d0ddf2666cc473430606f3b73c30bf2bc345","observation_id":"d5b2a3fd-29a2-458e-aedf-abb76efe81fc","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:50a2067f53912d5893a696d1e073b5d7a8968fc995dcf3f5626acc0f3f63c201","observation_id":"9875fa49-c68a-4ae9-a5f9-40f27f638e80","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:a92b6c0c4cba8a65825c320e0eb84f46b9479bff44e270b286979c04fc1a9531","observation_id":"234e7e7a-5111-4295-b2b9-f3e9b8338406","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:2a3b365937e13d5cb8c8dd7c2618abf34e7b16a753019928cdba7e0cad2bff75","observation_id":"c786bffa-61ca-400b-8d87-042e3a2ee519","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12513","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.658352Z","title":"Memrope: Training-free infinite video generation via evolving memory tokens","venue":null,"work_id":"3f8417c0-39e6-4d94-bed2-517565c1e90b","year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:f8a1239f1e4a81bd018923037cf764eed129f0a6154e56309f2b3b34feb8529c","observation_id":"d538c445-a712-4944-9340-31ca06c634a7","resolution":{"observed_at":"2026-07-01T22:16:17.120998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.03745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:37:37.460017Z","title":"Streamdit: Real-time streaming text-to-video generation","venue":null,"work_id":"d57dcd7d-4e3a-4c56-b5cb-95a51477cf97","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e5675f6de597cfdd317da46319f3cef1a79a3698ee167b2daaec10f21f25e067","observation_id":"2b46ee52-210a-4d96-b279-87ee5e052abe","resolution":{"observed_at":"2026-07-01T22:16:17.070863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:14744dc5ad30485e50f0f73c368f661fd9c393baef622b28e7430bfd6eec690d","observation_id":"13e1c57a-b89f-40f4-bd48-fb8c092e4078","resolution":{"observed_at":"2026-07-01T22:16:17.064109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:c72efcb94e71b1d854cec2ce0c47686eb24f9545d501964295c66895a4ae9689","observation_id":"32423705-8af1-41c2-86ec-a75e4d8bd551","resolution":{"observed_at":"2026-07-01T22:16:17.130087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:8cec49b97c358806f3bee2a06593a4cd2465ce0c1a634ecfe0928e8ea5b0b896","observation_id":"d6530432-3135-4981-8bd3-4a9aaab76019","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-08-15T00:49:04.808892Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"cited_work":{"arxiv_id":"2602.07775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07775","snapshot_observed_at":"2026-07-10T01:46:41.027454Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"ee9b6bbe-6f3e-4344-b631-395401ca5b33","year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2602.07775","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:c96d617e521eccb55395f6801e2677e7f8e3ef434dd86a6a920552cb6705f968","observation_id":"e5089731-5cc9-439b-8081-92062c9cb6e2","resolution":{"observed_at":"2026-07-01T22:16:17.165253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Vmem: Consistent interactive video scene generation with surfel-indexed view memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:dbbd296b7274512d03aa4cc3a203f0192c9a3c405cb1ef9c80f4e81b09d176cc","observation_id":"06b52ce3-d1a5-4042-b356-5e8ea3f2b046","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:59c1f7827f0738286209b9d68abe5f4583f71e057063f626d23d17ab6e22b362","observation_id":"7515b332-92ba-4166-81a0-c5ed3ba834c7","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":"2509.25161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-08T10:54:49.169100Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","venue":"cs.CV","work_id":"e44fcf99-6683-4319-a07d-0db4c89ff93c","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e5150e8c23ea3c883dc8c31d292cf16a729bb89ffd2463b4e0f86948768f0620","observation_id":"e66c6979-17b5-460a-9f4c-9a9821ba10a5","resolution":{"observed_at":"2026-07-01T22:16:17.133558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":"2402.17177","doi":"10.48550/arxiv.2402.17177","metadata_source":"pith","pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","venue":"cs.CV","work_id":"49aeafea-5763-4b8e-aff4-8fa617aacb1f","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:24bf300285db6c77f612bc8d96d8e35937c117c2b89629d9a8eb7ebfa445720e","observation_id":"353a8dda-00f8-4e79-b8fd-d32c2947d49b","resolution":{"observed_at":"2026-07-01T22:16:17.151698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"cited_work":{"arxiv_id":"2512.04678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04678","snapshot_observed_at":"2026-07-03T23:59:07.563782Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","venue":"cs.CV","work_id":"74f20348-bdc0-4c09-a8d2-999657fb3fea","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2512.04678","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:bf8ec4999c59bf153e5b0bc66ddb154c00c706613096df9dbd18d1a848bdf358","observation_id":"2a247fad-3c42-4a5b-b4df-7d473c9a5a14","resolution":{"observed_at":"2026-07-01T22:16:17.128441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-18T09:44:25.224559Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:314d3cc9ae2f268c558264b752445ca41dd54720eca0f6ef0bb84563f8bfa931","observation_id":"3a070dbd-9382-4694-bdd4-e36f39c8fd02","resolution":{"observed_at":"2026-07-01T22:16:17.154303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:8d0ad0f1e850b99d7f880318e915c58241169814e9cc4814d5cddda19877463f","observation_id":"205c466a-6e56-4aed-a246-b428cd211a6a","resolution":{"observed_at":"2026-07-01T22:16:17.157631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:84dd08f8ff31e2377817f5483a4a71023244f0df577fe49ece56c8d87d3ed00d","observation_id":"2484aa0b-8ceb-46ea-9bdc-704030918d48","resolution":{"observed_at":"2026-07-01T22:16:17.146203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-18T03:37:37.984355Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.09042","doi":"10.48550/arxiv.2506.09042","metadata_source":"pith","pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":"cs.CV","work_id":"af51168b-8b82-45d2-bf85-e3d07f99492b","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:b1fb7a11ee235bb2932491011d18ad38982cd5f8665d5c5c3abb39352d90c016","observation_id":"3968874c-7626-410a-9e7d-f568def196e7","resolution":{"observed_at":"2026-07-01T22:16:17.149223Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:df722621934fd1d99c4e216b30a9b0bb127355d068995a5ba5fedf085ba73439","observation_id":"78e9667e-542d-47f8-bebc-b5bccc38e8b8","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-14T16:23:20.854858Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":"2512.14614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-07-09T07:56:04.709254Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","venue":"cs.CV","work_id":"48231e12-6c15-4f28-8c51-092766c59f93","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:c207a3405833557ec8aefa6362af7ce306a0295cd5497a8c08959394b1852454","observation_id":"50e736c1-5a78-473a-b622-6c51556a3f54","resolution":{"observed_at":"2026-07-01T22:16:17.108119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-08-17T23:27:13.017878Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2505.13211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-07-10T01:46:41.063877Z","title":"MAGI-1: Autoregressive Video Generation at Scale","venue":"cs.CV","work_id":"25e8bd3d-e51c-43ae-8126-4ea6ecdb3321","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:6ce8fedb4bb7805d833ae56f85a288ea8e848b2d9c112c2f368b8b8add1e7b12","observation_id":"62a04c9c-e0e7-441e-92b0-2e8a1f530cdb","resolution":{"observed_at":"2026-07-01T22:16:17.136015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:0effda211924b2d83b41a6ae4255288579650db18916dda1607471c8e363109d","observation_id":"65f4f353-c4e6-4953-a3ef-faee9d55eef1","resolution":{"observed_at":"2026-07-01T22:16:17.151989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13035","last_updated":"2025-03-13T03:16:43Z","snapshot_observed_at":"2026-08-18T15:28:26.893195Z","submitted_at":"2024-06-18T20:01:51Z","title":"D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.13035","doi":"10.48550/arxiv.2406.13035","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.13035","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D2o: Dynamic discriminative operations for efficient long-context inference of large language models","venue":"arXiv (Cornell University)","work_id":"f09f2382-0966-4621-bead-fb76431fe32b","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2406.13035","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:bad194e79a0fdc593126f8a451a3e2e769e7b01a684483e3c84b401c8885da19","observation_id":"83cedd67-c583-4531-9e50-cf8b21c2b556","resolution":{"observed_at":"2026-07-01T22:16:17.161728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-08-18T15:25:17.604519Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":"2407.08454","doi":"10.48550/arxiv.2407.08454","metadata_source":"pith","pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":"cs.CL","work_id":"37bb89e4-ffbc-414a-858a-627e6d7be94c","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:154d445d808c3b083b419ff800f23dc501d61a8946b74381d8375b26ec119a64","observation_id":"c0039755-7157-4b59-9cf4-21d9d84c1986","resolution":{"observed_at":"2026-07-01T22:16:17.131178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:15.401223+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:15.401223+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.220855Z","title":"Infinite-World: Scaling interactive world models to 1000-frame horizons via pose-free hierarchical memory","venue":null,"work_id":"c6bda419-e0dc-45aa-b96b-eef3a31d0930","year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:429d1978d096686ed2733638bea576347d461e075dbb1eb1500bbda3d77e80bd","observation_id":"474be210-0e44-4c82-a7c7-4feead2d7d2a","resolution":{"observed_at":"2026-07-01T22:16:17.102369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:a339857db595ff7956bd2cdbc6361b37ae2ed149dfcd8493dfb53a74ae862a8a","observation_id":"3c0099a1-392f-428b-a268-a8995d82d437","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:338554806f23be32a8bda18feb5b71c22e09b33fb67096e9b5bd252e91786cab","observation_id":"2098fad8-8046-4a24-82ca-f73bc06a89a6","resolution":{"observed_at":"2026-07-01T22:16:17.094632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:97fe868b874edecafbaeff60d66cbb5332f54e4c764b3e21662671bd712adb87","observation_id":"021f163c-3e27-4f4b-beb6-555c471ae691","resolution":{"observed_at":"2026-07-01T22:16:17.091550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Longlive: Real-time interactive long video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:43bd4e2b4738d07161376f3914a6389eabac0e171293a2c3fb7bcf9fd4c02017","observation_id":"c2036fbb-d8cd-4a50-81eb-448c1308993c","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.15281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:16:17.115464Z","title":"StableWorld: Towards stable and consistent long interactive video generation","venue":null,"work_id":"ab2c77ce-372c-4a53-9607-aa228d0637eb","year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:899870a49bcda162bced505a83721f86e8a45de77e232ce06668ce4579370397","observation_id":"3615e140-07ac-4f51-942d-c2fc360b85f2","resolution":{"observed_at":"2026-07-01T22:16:17.117721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e12d0f6be66a475d5fbdb117a9f6fe0645a1969b321874f8f640bc365a6b7cbf","observation_id":"0252e0fe-45aa-4d8b-97bd-e95305c09d48","resolution":{"observed_at":"2026-07-01T22:16:17.138457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:07.583971Z","title":"Infinity-RoPE: Action-controllable infinite video generation emerges from autoregressive self- rollout","venue":null,"work_id":"bf98ead3-5902-4e92-9114-acd0c26e93c5","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:30df7e71becada1dd0cb9f3db6aff1afb5982b5d178379c92302a17826d37443","observation_id":"d47a84b8-683a-4eeb-9dc7-24dd70658a2f","resolution":{"observed_at":"2026-07-01T22:16:17.109517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.068839Z","title":"H., Nam, J., Yoon, H., and Kim, S","venue":null,"work_id":"fabd3943-d415-41a1-8ad1-279912c0d6f0","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:b512305df2b4af4cfc6bbdb87d4ba9c47406f4b0ff981e8aaa1a143f1d99e7fa","observation_id":"076f6853-1a94-4aef-b1fd-b6a35b90d3f1","resolution":{"observed_at":"2026-07-01T22:16:17.088439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:5e36a334e41668f3d976cd4a4fdf8ca453af3c39c5fcf0b6df5fadbf2cc626e0","observation_id":"8e564fdc-b079-44cb-bf58-06136220abd0","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:96f78d08e3828be5c23d0c29126d6225bca61a50e84629e8c716481382314a57","observation_id":"8a8ffcc0-e24f-4c80-b72f-fbeedcf9f225","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:0b25b6f9173fa5928ce160eb7147d03265d5627fbd35a99b2e47ab5e8fd032e7","observation_id":"aec43290-26b0-4a6b-9600-31ddf46de92c","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:8ce323256e24733aff2302a0195ab02b2d2d6c333c4f6534ad9b93aa16e7ec75","observation_id":"9db5a2ef-7254-426f-b283-fb76b2885a23","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Language model beats diffusion - tokenizer is key to visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e3ba1c99c068473b9d4fba49ae8757dc918e3daf01538e917070816812ba76c7","observation_id":"375c1ab6-7bb5-44cd-aef0-571619d81c86","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.172551Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval","venue":null,"work_id":"7aca9998-ca88-48ca-bf11-5e95a18cc40d","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:1b986715aa05f4207dd8e649d84671d07ce6b0b2ee8b02eb7958842ac0544841","observation_id":"ef9eff07-00a9-4632-a500-cebe76e20a12","resolution":{"observed_at":"2026-07-01T22:16:17.110986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Stargen: A spatiotemporal autoregression framework with video diffusion model for scalable and controllable scene generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:faa343133cf00f32efeca5c9889a43207bd5f1d228542bb0b12bcfc9e2104148","observation_id":"1ab2f700-39c6-4444-bb5d-3ea0d961b2ce","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Packing input frame context in next-frame prediction models for video generation.arXiv e-prints, pages arXiv–2504, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:bcc9280e0c5bb888bb4cf54351c738cf104946c94f0cb252cc63463dff3d49b8","observation_id":"635d6e9e-5e2f-4c06-874d-0eb4c04d84c1","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23851","last_updated":"2026-06-20T17:45:12Z","snapshot_observed_at":"2026-08-15T05:46:16.274051Z","submitted_at":"2025-12-29T20:29:21Z","title":"TinyHistory: Lightweight Video History Embeddings via Two-Stage Context Learning","version":6},"cited_work":{"arxiv_id":"2512.23851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23851","snapshot_observed_at":"2026-07-08T10:54:49.285896Z","title":"Pretraining frame preservation in autoregressive video memory compression.arXiv preprint arXiv:2512.23851","venue":"cs.CV","work_id":"a4a56508-e373-443d-9eae-e2cc37da9d05","year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2512.23851","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e346b55f00faa8e8d04aee73733a79b7ae8f0344d46b407d8ca1b067bed03267","observation_id":"dc27a006-98f9-4ac3-8ae8-e01a88622b26","resolution":{"observed_at":"2026-07-01T22:16:17.123706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"Cam: Cache merging for memory-efficient llms inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e4fa740acdb2681fe0917ba0dd62f30c0d349afe77aa9508af7e6bd89de2d715","observation_id":"abd8b0aa-b40a-4a04-b0b3-d3f3ea216924","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:748bf89c9746f5533bf5021d7c338cdbcd034afaf39fc827af46252a7b329f67","observation_id":"b36aa14f-9531-4077-8535-300251461a30","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:28:41.932618Z","title":"RIFLEx: A free lunch for length extrapolation in video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:e6343cc043bf25a6ac7d6ea58d825612ac3a4766c6557d7b3db2b8bf03bf76ed","observation_id":"5d51b3aa-d637-44ef-a252-95dea4e4bcc3","resolution":{"observed_at":"2026-06-28T15:28:41.932618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-17T22:01:08.736822Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":"2602.02214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-07-10T13:47:05.847304Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","venue":"cs.CV","work_id":"04f67f5b-e79a-4ad9-8e90-763e5e54bd3d","year":2026},"citing_paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T15:28:41.932618Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2606.02553"},"observation_digest":"sha256:3a2c5d5103764a1b7074826e8cb5c5bd1c176897c435c21b195a2791aa63de17","observation_id":"a9d67a86-6916-4d75-bb47-dc93e3f91934","resolution":{"observed_at":"2026-07-01T22:16:17.115138Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.02553","last_updated":"2026-06-01T17:50:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T15:27:08.350659Z","submitted_at":"2026-06-01T17:50:49Z","title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":30,"verified_exact":34,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2606.02553."}