{"as_of":"2026-08-07T08:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4525d05618b35f0ed2c72e3e4700603b3a18cc106955ed5d86be8513c0be83b0","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T23:47:57.945910Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26694/citation-record","integrity":"/paper/2607.26694/integrity","json":"/paper/2607.26694/citation-record.json","paper":"/paper/2607.26694"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.678696Z","title":"Video generation models as world simulators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.678696Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:a4774c833af9064e857a8117c41454dd2570d45c67a221702ad14ff2f47325ed","observation_id":"119b8db1-85c2-4e26-847b-85fd9de97775","resolution":{"observed_at":"2026-07-30T23:47:57.678696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.682671Z","title":"Veo: Our leading video generation model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.682671Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:0f346ca997690712a9c10e435d2539195c4c38550ef39fa63def81fd7b5d3dfe","observation_id":"c4f69de2-4442-414f-8ff1-51cf83a0cfc7","resolution":{"observed_at":"2026-07-30T23:47:57.682671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-07-30T23:47:57.685743Z","title":"Seedance 1.0: Exploring the boundaries of video generation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.685743Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:9359c70709524688a3c19d3020938c30026cbe51c5c06ab9550753989ef3d3af","observation_id":"1b95efa5-6a39-49ee-896a-3762a8928b3b","resolution":{"observed_at":"2026-07-30T23:47:57.685743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-07-30T23:47:57.689792Z","title":"Kling-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.689792Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:2145bdccd739535196568be300d1c8306afe60659d45f55a9c3337dab66b641b","observation_id":"e1a7e7f4-e501-4ecc-9450-9fbaa40a3b3b","resolution":{"observed_at":"2026-07-30T23:47:57.689792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-30T23:47:57.693073Z","title":"Wan: Open and advanced large-scale video generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.693073Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ba03bdb9dd5df176210d96254d1b1c0ebcd0567a5f5de691446c0174bd2bcd1d","observation_id":"6589d853-c4e0-4ee5-9586-d673c5ff0fa3","resolution":{"observed_at":"2026-07-30T23:47:57.693073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-30T23:47:57.696305Z","title":"Hunyuanvideo: A systematic framework for large video generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.696305Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:889ab3fce928280d4d17d69b8b87581be7011f765fa2817f64690551d7b3d137","observation_id":"a631d33e-a971-47c9-a012-d3fc0568da33","resolution":{"observed_at":"2026-07-30T23:47:57.696305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.699846Z","title":"Longcat-video technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.699846Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:e531bcaea17e79bbfb13712f13b79d483ad1fa39fd8918e8797208bd4a7d780a","observation_id":"b8e552ff-9ce6-4029-8af6-367750da4d08","resolution":{"observed_at":"2026-07-30T23:47:57.699846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.702649Z","title":"From slow bidirectional to fast autoregressive video diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.702649Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:2323fdf74ede6d875f7d96578c540bc044dc44ca4f646508ee2687de6624e74f","observation_id":"8f173b74-7571-47c5-8a13-7612480e4e3a","resolution":{"observed_at":"2026-07-30T23:47:57.702649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-30T23:47:57.706053Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.706053Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:6083cff48b62457f6d0ae4be3fc3ed81c9790264c8e5993bf674980853421202","observation_id":"a300975e-3353-4c21-ab78-536adb0128b2","resolution":{"observed_at":"2026-07-30T23:47:57.706053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-30T23:47:57.709089Z","title":"Rolling forcing: Autoregressive long video diffusion in real time,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.709089Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:8df36913a0610fb970f6820a24954c3053e0b8c8e8c14bfe357e1141edee210b","observation_id":"918f1571-532c-46de-b3a3-360046debc0f","resolution":{"observed_at":"2026-07-30T23:47:57.709089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-07-30T23:47:57.712160Z","title":"Causal forcing: Autoregressive diffusion distillation done right for high-quality real-time interactive video generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.712160Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:297acbb21ded6e6ff89c1eb6f94e6dfb0ed0f652796efd62dfb5dd4ef49a0444","observation_id":"2b30936d-db35-4e7d-bc17-9652c991727a","resolution":{"observed_at":"2026-07-30T23:47:57.712160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.715311Z","title":"Oasis: A universe in a transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.715311Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:29f8e487eb2edac8a2ad58c7cd97568b150ac904556fa3bb7fc330b288d0cb6b","observation_id":"743239df-7e87-40c2-9a70-4bc703771f88","resolution":{"observed_at":"2026-07-30T23:47:57.715311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-30T23:47:57.718147Z","title":"Longlive: Real-time interactive long video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.718147Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:0c84d2567ca92a478530083123f7bfbd93e32aba79ea5630d7440cb88e46776c","observation_id":"342fc3e8-8203-456e-919c-4584ae5408b8","resolution":{"observed_at":"2026-07-30T23:47:57.718147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-07-30T23:47:57.721001Z","title":"Matrix-game 2.0: An open-source, real-time, and streaming interactive world model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.721001Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:36ce5c3a1486706361e990588cecbaf496254566e6e7e600c005e5682911add6","observation_id":"b34a2f2d-af1c-4e65-bbdd-6193f69433ec","resolution":{"observed_at":"2026-07-30T23:47:57.721001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.723937Z","title":"Krea realtime 14b: Real-time, long-form ai video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.723937Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:4ff2bf3debbcc987b805e7fbf8175e6fe827615408bb0c2bcb91dbbc7efe9eb9","observation_id":"636ea20b-3601-4095-a04e-20e653d48fed","resolution":{"observed_at":"2026-07-30T23:47:57.723937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.726642Z","title":"Helios: Real real-time long video generation model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.726642Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ec7a7e33e860d9666e02a8022d7a1e844d6a743ce02f7c58ea9b185fc9c4e08f","observation_id":"5f0a13b1-c258-479a-80ae-6c28225c284a","resolution":{"observed_at":"2026-07-30T23:47:57.726642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-06T11:22:14.847939Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03118","snapshot_observed_at":"2026-07-30T23:47:57.729629Z","title":"Vidu s1: A real-time interactive video generation model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.729629Z"},"links":{"cited_paper":"/paper/2607.03118","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:cb2a0b0bc1fc606f75808388e70ff36f2cb7e5b2042af21405da76d7ddfbad58","observation_id":"07857c41-bc51-4ef3-80d4-f446320f17d1","resolution":{"observed_at":"2026-07-30T23:47:57.729629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.732515Z","title":"Frame context packing and drift prevention in next-frame-prediction video diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.732515Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:713c92681324c0d4e24e24e235bb8ba5e34fa2b55afa0ade1db23b690f2c027f","observation_id":"14f8fc9f-3e98-4e9c-88a8-9d4d85a0827c","resolution":{"observed_at":"2026-07-30T23:47:57.732515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-07-30T23:47:57.735265Z","title":"Long-context autoregressive video modeling with next-frame prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.735265Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:339f1fa81ccd0dc4c2bde33cb4f3e696db16295927a0f4408ccc49ff74b57063","observation_id":"1d54aefe-38e5-45d2-acde-da0d86ab725a","resolution":{"observed_at":"2026-07-30T23:47:57.735265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.738102Z","title":"Memflow: Flowing adaptive memory for consistent and efficient long video narratives,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.738102Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:e881f7cba3398cf6d27efa8c46daf8572e2a088803e7f6a06a3bbc84e953594d","observation_id":"81825120-4cc8-4a8f-9dee-62b0255e0e22","resolution":{"observed_at":"2026-07-30T23:47:57.738102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.740778Z","title":"Videossm: Autoregressive long video generation with hybrid state-space memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.740778Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:509caaf837100da18783d1d48df8c8ae35e5780e389b86d5021b8dcec36c5fcf","observation_id":"ea882b50-5bcc-4210-87b4-e06912857d1b","resolution":{"observed_at":"2026-07-30T23:47:57.740778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10671","last_updated":"2026-08-04T12:43:00Z","snapshot_observed_at":"2026-08-07T08:19:53.469659Z","submitted_at":"2026-06-09T10:22:18Z","title":"FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10671","snapshot_observed_at":"2026-07-30T23:47:57.743413Z","title":"Fademem: Distance-aware memory consolidation for autoregressive video diffusion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.743413Z"},"links":{"cited_paper":"/paper/2606.10671","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:b874854d258d384581f026f8d86b8ba08d510a3cd62a990be70a98dbf138471b","observation_id":"38dadd9b-6d21-46ab-8e35-5a2595b34360","resolution":{"observed_at":"2026-07-30T23:47:57.743413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04527","last_updated":"2026-06-03T07:09:01Z","snapshot_observed_at":"2026-08-06T03:22:24.182739Z","submitted_at":"2026-06-03T07:09:01Z","title":"Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04527","snapshot_observed_at":"2026-07-30T23:47:57.746362Z","title":"Echo-infinity: Learning evolving memory for real-time infinite video generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.746362Z"},"links":{"cited_paper":"/paper/2606.04527","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:17ecd3ebd748b045fe278bee7f5f231dc3484ab082007a8d51dd2f8372542421","observation_id":"c8b3cb79-70e1-4887-aca0-2c8dc3a06e64","resolution":{"observed_at":"2026-07-30T23:47:57.746362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.749504Z","title":"Introducing live models: A frontier for world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.749504Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:aacc18827b7fd4b40d4d402bf5f0f23bc44b83ee7fcb823bb03ab1b61507746b","observation_id":"3536c481-f909-4c46-b043-ebb16cc45cce","resolution":{"observed_at":"2026-07-30T23:47:57.749504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-30T23:47:57.752509Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.752509Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:00bb156f64f2a227a5146604cafbcc25b16f137101e41d84d97ec414fa4d6409","observation_id":"2af81da1-5a35-4ec6-8f31-078701ba5f68","resolution":{"observed_at":"2026-07-30T23:47:57.752509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.755520Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.755520Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:1804ff28a235ccf3f834e4ec471dddb4be5619d3724f37915d5b2abeff2b5a1c","observation_id":"e1e94a56-6bf0-4755-8bac-c1cdd7a5a625","resolution":{"observed_at":"2026-07-30T23:47:57.755520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-30T23:47:57.758428Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.758428Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:1fe7157371771dd7c2d4b5a2404375519c12e12de7481df289d8ec8a253dae72","observation_id":"65636fc4-4efc-45fc-a192-0bbb15eee1e1","resolution":{"observed_at":"2026-07-30T23:47:57.758428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.761305Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.761305Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:523c20feffc27802d771cedd252295b17ffdd4b1c88654bb9ee7756650c76a3e","observation_id":"9d3cb127-2c42-4fe0-af78-dea5627c57cc","resolution":{"observed_at":"2026-07-30T23:47:57.761305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-07-30T23:47:57.764423Z","title":"Movie gen: A cast of media foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.764423Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:e22d75946f6540cfec68c53221ce18a186f4916c02d9a8c9d2a23ac9e0a7b6a1","observation_id":"4678c123-1bae-41c8-9f8a-4bbfb7e58c7c","resolution":{"observed_at":"2026-07-30T23:47:57.764423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09010","last_updated":"2021-12-01T20:29:42Z","snapshot_observed_at":"2026-08-06T13:05:51.883274Z","submitted_at":"2018-03-23T23:22:18Z","title":"Datasheets for Datasets","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09010","snapshot_observed_at":"2026-07-30T23:47:57.767475Z","title":"Datasheets for datasets,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.767475Z"},"links":{"cited_paper":"/paper/1803.09010","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:d485209e0181cefe5ad1e921798385ff215175bd6553271b8bf36f5d05226061","observation_id":"f4b586b9-91dd-466b-aa28-1943ef1cfdb8","resolution":{"observed_at":"2026-07-30T23:47:57.767475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.770669Z","title":"Data cards: Purposeful and transparent dataset documentation for responsible ai,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.770669Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ef7a1f9fd44a32c53b5df8ed6c5273fa775c140fcbac013fb0f4222fec9958ed","observation_id":"c70b5515-c6f0-46e5-8a52-3421180b48a0","resolution":{"observed_at":"2026-07-30T23:47:57.770669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-03T19:11:12.569454Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-07-30T23:47:57.773407Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.773407Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:788b37d03ec9a05782f4a1608e8aba2207434b67882e7ca8996113480e2db405","observation_id":"e46d4e7c-a0bd-4e56-890c-e35c1c7c8cb4","resolution":{"observed_at":"2026-07-30T23:47:57.773407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.776612Z","title":"Dense-captioning events in videos,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.776612Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:c16f70074324ee78a1a6b7007e2f2fd61657670bc0c463e8025e46fc30d214ae","observation_id":"e1ae40e0-aa1f-43c6-8d84-e2328731ddf4","resolution":{"observed_at":"2026-07-30T23:47:57.776612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.779266Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.779266Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:7ef4a3766396a610b4bf76843487f3758432f40e588dcaed9cd2459544b5fb7a","observation_id":"d9da8328-bb77-4868-9d8b-ccd085b455e3","resolution":{"observed_at":"2026-07-30T23:47:57.779266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-07T01:27:15.618968Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-07-30T23:47:57.782044Z","title":"Miradata: A large-scale video dataset with long durations and structured captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.782044Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:467b5fb42e58d3cbaee70a92b06afa76746eb597365dcc1d80d6bce4b99119dc","observation_id":"89eab255-b671-42bc-82e4-20375aa5c10b","resolution":{"observed_at":"2026-07-30T23:47:57.782044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.785184Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.785184Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:87ab72df93d5f288ebe88b5e7541923a58d33d5e13eac1fa6bc0effd29f97efc","observation_id":"16730e98-358b-4393-836b-c1e79adb5c62","resolution":{"observed_at":"2026-07-30T23:47:57.785184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.787917Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.787917Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:86b06d36ed5fa2f21cfee790a152aa2aa8f55d5b502b5a89b42cc2adb284d187","observation_id":"1a576362-0f7e-441c-8d9e-b13cf9c285fd","resolution":{"observed_at":"2026-07-30T23:47:57.787917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09803","snapshot_observed_at":"2026-07-30T23:47:57.790816Z","title":"Echo-memory: A controlled study of memory in action world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.790816Z"},"links":{"cited_paper":"/paper/2606.09803","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:f33944506222a47f6225d763f74430a6ffafdba4c5df9295d9161dd6fe4f03a5","observation_id":"ae2b5e09-62d8-4085-9e15-2aea3b140303","resolution":{"observed_at":"2026-07-30T23:47:57.790816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.793775Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.793775Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:bb152ab36a6840b1402176a43cfc3c691826fa7d9c4c70f61b760dffeba47eda","observation_id":"41a94a74-d44d-4817-b6fa-1f599b37bab2","resolution":{"observed_at":"2026-07-30T23:47:57.793775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.796836Z","title":"On distillation of guided diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.796836Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:270b67db8ffd76c8b7647332ad9aabb0008d8cf1039fce0f106661a83e83b95f","observation_id":"59d38cfd-92af-4b0f-8a2f-3b118f0c93db","resolution":{"observed_at":"2026-07-30T23:47:57.796836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.800010Z","title":"Consistency models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.800010Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:c33bbc8768a933497f195e36b35cc353fdfdb3bee4f256c1633d12d39152db1f","observation_id":"0fc4640e-0f02-4a02-bdb3-d8ae90eef0ed","resolution":{"observed_at":"2026-07-30T23:47:57.800010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.802733Z","title":"Large scale diffusion distillation via score-regularized continuous-time consistency,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.802733Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:d646e73d303dd9c624c84cb53de8c90bcb02b6db5f352a0ed366bd788a7d959f","observation_id":"bd15b87d-091d-444a-b8c5-82db33750bb8","resolution":{"observed_at":"2026-07-30T23:47:57.802733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-08-05T22:45:50.916812Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.25473","snapshot_observed_at":"2026-07-30T23:47:57.809288Z","title":"Causal-rcm: A unified teacher-forcing and self-forcing open recipe for autoregressive diffusion distillation in streaming video generation and interactive world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.809288Z"},"links":{"cited_paper":"/paper/2606.25473","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:41e2e3b526123d890191663b4092d31adc188a1af978d69491defaf83d5e8057","observation_id":"462dabd5-bcc9-4100-8442-9a529fc8f686","resolution":{"observed_at":"2026-07-30T23:47:57.809288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.812327Z","title":"One-step diffusion with distribution matching distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.812327Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:5da1a8e3f59e74c1fb4d7603ad532c23e30b4e6b619782a468945442f2f67a67","observation_id":"08aa8371-4eb1-4afb-9986-3d6a4625cb17","resolution":{"observed_at":"2026-07-30T23:47:57.812327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-30T23:47:57.815116Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.815116Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:a9c2f7e0543910435010a3b486fc3414744cb080d98dfd9189741ebef765b905","observation_id":"d395a853-2110-4ca6-a570-29e30bd855aa","resolution":{"observed_at":"2026-07-30T23:47:57.815116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-30T23:47:57.818112Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.818112Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ec0df3d2679e90a148020ab725c4386691662bd2b011a28c11637ffe5e5d53e9","observation_id":"5bd1b5ca-12a6-49f3-a285-2c2cd3dddaf4","resolution":{"observed_at":"2026-07-30T23:47:57.818112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-30T23:47:57.821070Z","title":"Flow-grpo: Training flow matching models via online rl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.821070Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:5e0eaf18f43d58cc28b67967333ff78708ca19107d0d7bd7cd17a1faec0905fb","observation_id":"aa1c52fb-c44f-4d6e-a37e-74d36bb61e99","resolution":{"observed_at":"2026-07-30T23:47:57.821070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-30T23:47:57.824464Z","title":"Dancegrpo: Unleashing grpo on visual generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.824464Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:53bd89dae5487e19b443c2430c0bf5f320e4c9908a4f1af2e6b247d8e99488ed","observation_id":"740bc92b-94b2-4725-b5d5-0ec2cbce1e67","resolution":{"observed_at":"2026-07-30T23:47:57.824464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-07-30T23:47:57.827331Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.827331Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:4f70f6080ac016b1cee5e4e67df851e3e57ecfd3ba4d9dc40bcb4f0f3164263b","observation_id":"0f680888-6d27-493a-acb4-eacb452cdf3a","resolution":{"observed_at":"2026-07-30T23:47:57.827331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09136","last_updated":"2025-08-12T17:59:46Z","snapshot_observed_at":"2026-08-05T21:13:33.045132Z","submitted_at":"2025-08-12T17:59:46Z","title":"Turbo-VAED: Fast and Stable Transfer of Video-VAEs to Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09136","snapshot_observed_at":"2026-07-30T23:47:57.830099Z","title":"Turbo-vaed: Fast and stable transfer of video-vaes to mobile devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.830099Z"},"links":{"cited_paper":"/paper/2508.09136","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:676c4414c17774aba5139b785f0cab6e6666997038f112d7c7a284cede319470","observation_id":"86b27efc-1e8a-406e-8a61-98c8ca2b192a","resolution":{"observed_at":"2026-07-30T23:47:57.830099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.833218Z","title":"Flash-vaed: Plug-and-play vae decoders for efficient video generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.833218Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:bc42853d2bd6185a90225a85f1b1308b1db33ea2c62a4a8dbbfe60974e70ee13","observation_id":"ce2c3865-682a-4a09-bec4-1b9e9d51acb5","resolution":{"observed_at":"2026-07-30T23:47:57.833218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.835858Z","title":"Image quality assessment: Unifying structure and texture similarity,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.835858Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:78817a18fab071f4a4ee6dc0263cb33ee3fbfe5ba9116175eeae3a58fad55279","observation_id":"739fd225-1a51-40b7-93d1-2067a1ebad7b","resolution":{"observed_at":"2026-07-30T23:47:57.835858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.838633Z","title":"Frame-recurrent video super-resolution,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.838633Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:9978fcbd0d9e0a5ae443ac4dff7198476dbc4a1f1da803521f1ea03da5b35111","observation_id":"f0d74d8f-d370-429f-a127-19f65fdc8ab9","resolution":{"observed_at":"2026-07-30T23:47:57.838633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.841341Z","title":"Learning temporal coherence via self-supervision for gan-based video generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.841341Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ab54514d45e871022d834bf525684148c4cd7e942ec01daf432cc42b195e9d91","observation_id":"bb07e711-23b2-4300-abd0-9f71c77accea","resolution":{"observed_at":"2026-07-30T23:47:57.841341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.844321Z","title":"RAFT: Recurrent all-pairs field transforms for optical flow,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.844321Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:0919f2eb8dad0fc7ec64fcc5f573a6c50951006d374f172c459542ea5b5d8a0f","observation_id":"65bd2f22-f9e5-4460-90e6-cfff0ff4c1ee","resolution":{"observed_at":"2026-07-30T23:47:57.844321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12288","last_updated":"2022-06-15T17:17:05Z","snapshot_observed_at":"2026-08-07T03:43:40.562956Z","submitted_at":"2022-01-28T17:54:43Z","title":"VRT: A Video Restoration Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12288","snapshot_observed_at":"2026-07-30T23:47:57.847169Z","title":"VRT: A video restoration transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.847169Z"},"links":{"cited_paper":"/paper/2201.12288","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:6817cbc076e79226d980b7ee7b306de10899a9ba08755e3f7c9857f48dce6432","observation_id":"74c9f9aa-0a45-4f31-9ce7-37634b401ab0","resolution":{"observed_at":"2026-07-30T23:47:57.847169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.850122Z","title":"Recurrent video restoration transformer with guided deformable attention,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.850122Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ed3e0ab4d375ca47e779729dbc2fb12d54de1e5a563e0c65b7476067488b779e","observation_id":"f9c7c716-4592-48cc-9c8e-fb1fb16bf7a6","resolution":{"observed_at":"2026-07-30T23:47:57.850122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.852693Z","title":"BasicVSR++: Improving video super-resolution with enhanced propagation and alignment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.852693Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:26c561dc96a29f2eff93d54c7aa4d355648c3962a7889e96baacd5f5de876d82","observation_id":"8f2a30c4-c29e-46af-99be-db387ba88976","resolution":{"observed_at":"2026-07-30T23:47:57.852693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-07-30T23:47:57.855314Z","title":"Roformer: Enhanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.855314Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:5f6c3b0b1c863e1ad0bb9ca2512b4b5e3a765375e67ede921bc53622480c91b4","observation_id":"6e42628b-33f4-47ad-ab21-cc7644e623bc","resolution":{"observed_at":"2026-07-30T23:47:57.855314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-07-06T16:44:55.494764Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-07-30T23:47:57.858093Z","title":"Prompt cache: Modular attention reuse for low-latency inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.858093Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:2c5806e096a3cf910251ac9234420d0445ba545e92f377faf6dc53933d83fd8a","observation_id":"0be0343d-266a-43a5-9403-52a7359ec686","resolution":{"observed_at":"2026-07-30T23:47:57.858093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-07-30T23:47:57.861226Z","title":"SGLang: Efficient execution of structured language model programs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.861226Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:0d74431e0b7a1ddc522a3bbff4ada6d363df76a8ff0976791b01c075d5dcc630","observation_id":"d45b01cd-95c7-471d-ad25-adec4d2a4d18","resolution":{"observed_at":"2026-07-30T23:47:57.861226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18739","last_updated":"2026-05-19T17:46:12Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:03Z","title":"LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18739","snapshot_observed_at":"2026-07-30T23:47:57.864206Z","title":"Longlive-2.0: An nvfp4 parallel infrastructure for long video generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.864206Z"},"links":{"cited_paper":"/paper/2605.18739","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:e106f9dc556e91c2ffd0ab36211d83e3d745594473397ef3d3586668633bab42","observation_id":"4798e726-76a1-473a-a697-b70580360376","resolution":{"observed_at":"2026-07-30T23:47:57.864206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.867394Z","title":"TVM: An automated end-to-end optimizing compiler for deep learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.867394Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:da33fea0ae27cb8ce00317f26b064ffece418c6890d9f5187a41b26e84a35585","observation_id":"7852bbb1-1b80-4d39-a3e1-2fe7ba468de0","resolution":{"observed_at":"2026-07-30T23:47:57.867394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.870616Z","title":"Triton: An intermediate language and compiler for tiled neural network computations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.870616Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:aeea443c056d38f421718a9a945da685257b1180294151fe962884beeb5b2bf5","observation_id":"df9d6018-af7e-4854-a071-2b2ebd24f537","resolution":{"observed_at":"2026-07-30T23:47:57.870616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.873423Z","title":"PyTorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.873423Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:48c471a82e2e3e6e2d9ed47a53e8a150e9bc9495b456e4fb59f9fa9e3665acaf","observation_id":"f6316650-f7be-4e2f-a6d9-d65fdaaf4f63","resolution":{"observed_at":"2026-07-30T23:47:57.873423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.876207Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.876207Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:cc20c18c37f0247f32886b14eef18290a640e235a548c5b92adf83af91939d7a","observation_id":"28ddaf04-2a35-48ee-a3e6-8c6565410b92","resolution":{"observed_at":"2026-07-30T23:47:57.876207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04867","last_updated":"2023-10-17T04:13:57Z","snapshot_observed_at":"2026-08-07T03:42:28.069320Z","submitted_at":"2023-02-09T18:59:48Z","title":"UniPC: A Unified Predictor-Corrector Framework for Fast Sampling of Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04867","snapshot_observed_at":"2026-07-30T23:47:57.878967Z","title":"UniPC: A unified predictor-corrector framework for fast sampling of diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.878967Z"},"links":{"cited_paper":"/paper/2302.04867","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:51251b2514cc36b792bb4c90ac6f877890940663c9cf7f5e3eca7b449c372981","observation_id":"51090a5d-27b4-4f4e-8b55-b4a4e3bbcfe2","resolution":{"observed_at":"2026-07-30T23:47:57.878967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.881662Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.881662Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:3a1da6a89850f3cc5c17e23df7b8f8904c42ba9cafd83cb7a89854cf5af1a977","observation_id":"b88aa0ef-8f84-4fcf-84de-f5f567a42ac3","resolution":{"observed_at":"2026-07-30T23:47:57.881662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.884257Z","title":"ViDiT-Q: Efficient and accurate quantization of diffusion transformers for image and video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.884257Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:c7f49155bc82e74453abe0949f24e6859f0d3555d5638419f5a2df1f7d52095a","observation_id":"906f0752-2575-4bdc-a3a1-5ae44dcc4fc9","resolution":{"observed_at":"2026-07-30T23:47:57.884257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-07-30T23:47:57.887022Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.887022Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:578725e4483eb27bd648963c96b34dce832b9e1ee1d322fb65f900221caf2f75","observation_id":"2d093340-a2ca-48b4-880b-b5165b5b441e","resolution":{"observed_at":"2026-07-30T23:47:57.887022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-07-30T23:47:57.889898Z","title":"USP: A unified sequence parallelism approach for long context generative ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.889898Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:a8b3ecdaeb86a9100b202e6d3862b3fde853a2f25e8b2b2e5913bed46476a56c","observation_id":"f23fd680-13ce-4d08-9057-59cc9050ff1b","resolution":{"observed_at":"2026-07-30T23:47:57.889898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01738","last_updated":"2024-11-04T01:40:38Z","snapshot_observed_at":"2026-08-06T20:23:19.678716Z","submitted_at":"2024-11-04T01:40:38Z","title":"xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01738","snapshot_observed_at":"2026-07-30T23:47:57.892972Z","title":"xDiT: An inference engine for diffusion transformers with massive parallelism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.892972Z"},"links":{"cited_paper":"/paper/2411.01738","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:4e37dd4a935251a1d75f5a40780f239ac6457663efb3285873fa3b1ece4faf6a","observation_id":"a2c7d9a4-3ec5-4341-8786-5d08f8ca2f8f","resolution":{"observed_at":"2026-07-30T23:47:57.892972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17459","last_updated":"2025-04-11T12:31:07Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:23:53Z","title":"WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17459","snapshot_observed_at":"2026-07-30T23:47:57.896030Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.896030Z"},"links":{"cited_paper":"/paper/2411.17459","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:68b199fe34943f3f3efdaed2239e50fe525d421fe8d7489017ff4e6efdb4f5c3","observation_id":"813a8fc3-ef73-4da0-8746-353eabb0d679","resolution":{"observed_at":"2026-07-30T23:47:57.896030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15894","last_updated":"2025-08-07T08:48:51Z","snapshot_observed_at":"2026-07-06T20:40:48.267387Z","submitted_at":"2025-02-21T19:28:05Z","title":"RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15894","snapshot_observed_at":"2026-07-30T23:47:57.898862Z","title":"RIFLEx: A free lunch for length extrapolation in video diffusion transformers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.898862Z"},"links":{"cited_paper":"/paper/2502.15894","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:57fbfd9172e70da636e15029ad49a0f8872483a9ade7cb0c91d1a71c2df0806f","observation_id":"44ad53d7-0023-4118-b743-58da8dcbc5d7","resolution":{"observed_at":"2026-07-30T23:47:57.898862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.901907Z","title":"Inference-time physics alignment of video generative models with latent world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.901907Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:6893ec737846c8dea029dd0f911452fec4f400064ef9bac19330d404b3e87c9a","observation_id":"4a5a2229-9ae8-4ca9-bdcd-93fa83c599fa","resolution":{"observed_at":"2026-07-30T23:47:57.901907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-07-30T23:47:57.904622Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.904622Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:69f58742ed4bc0cc67f3bcc0cf0a0fb45a89b77fa78844b623c5d76c25baa061","observation_id":"c2fb7fca-207d-474e-8e28-1c57cfa4cce6","resolution":{"observed_at":"2026-07-30T23:47:57.904622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.907505Z","title":"Narrlv: Towards a comprehensive narrative-centric evaluation for long video generation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.907505Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:95999614b1bd18db5dcad9b2f44798a8740c051fd49f2b00a67f35e69777a6d7","observation_id":"175c35dd-c2c0-4bc5-b059-319db8fe4809","resolution":{"observed_at":"2026-07-30T23:47:57.907505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30090","last_updated":"2026-05-28T15:35:34Z","snapshot_observed_at":"2026-08-02T05:10:06.145713Z","submitted_at":"2026-05-28T15:35:34Z","title":"DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30090","snapshot_observed_at":"2026-07-30T23:47:57.910030Z","title":"Directorbench: Diagnosing long-form video generation with personalized multi-agent evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.910030Z"},"links":{"cited_paper":"/paper/2605.30090","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ce2eab6a9c7d0f6666609994b116ff91d8c49ae446b5188321f43a92a8ccf449","observation_id":"31342146-3dac-4bc3-96fd-3af25ff9da09","resolution":{"observed_at":"2026-07-30T23:47:57.910030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.912840Z","title":"Infinitystar: Unified spacetime autoregressive modeling for visual generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.912840Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:21f49f7fe285b2a014a9cdc39df2501cd1a7a32ee4cb4531a780f2c2af0c9420","observation_id":"2b043c33-33cb-402b-b749-963879efd3a2","resolution":{"observed_at":"2026-07-30T23:47:57.912840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.915599Z","title":"Sana-video: Efficient video generation with block linear diffusion transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.915599Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:ef88b0422a5696689bcbdff566c390947b60ea99c0581db59d7770be8076c604","observation_id":"125825da-b13d-49ec-9983-75752784bf59","resolution":{"observed_at":"2026-07-30T23:47:57.915599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-07-06T19:53:17.024873Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-07-30T23:47:57.918287Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.918287Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:3bf50078dbfaa8841c9a033fb322e006f82bf09eea947bf1f2fd7bbb316182f1","observation_id":"eaa7affd-b072-4f8d-b1e8-8e07201085c2","resolution":{"observed_at":"2026-07-30T23:47:57.918287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.921238Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.921238Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:636b12829c81ce298a7007851cdcf6a8f979eb03e31db71bb77c72f7dcb3d824","observation_id":"46f14963-5989-4ef3-89f4-f8e49c7ffed7","resolution":{"observed_at":"2026-07-30T23:47:57.921238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.923727Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.923727Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:f958bf97335e10b11746534ff6a566be1a46c52e2bf35b19b84dfee3c50b309b","observation_id":"6bb0b69c-3896-4ccb-b7a2-8d6d8cd9fdce","resolution":{"observed_at":"2026-07-30T23:47:57.923727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.926426Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.926426Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:61f665caa66f16535d20716c3eea82e29082a496f12323f734f41c194294c7e4","observation_id":"997aa4ef-b18a-48cd-aae7-55c33d33ae7d","resolution":{"observed_at":"2026-07-30T23:47:57.926426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-30T23:47:57.929110Z","title":"Improving video generation with human feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.929110Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:92d3f78731c7ef804aa33cd7f4db5b7fff2bf60f39503cdc16f1535f6ee021b7","observation_id":"ea606aff-3223-4be4-9c6e-6a685ca84cd0","resolution":{"observed_at":"2026-07-30T23:47:57.929110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03789","last_updated":"2025-08-22T08:53:37Z","snapshot_observed_at":"2026-08-06T04:22:44.373906Z","submitted_at":"2025-08-05T17:17:13Z","title":"HPSv3: Towards Wide-Spectrum Human Preference Score","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03789","snapshot_observed_at":"2026-07-30T23:47:57.932110Z","title":"HPSv3: Towards wide-spectrum human preference score,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.932110Z"},"links":{"cited_paper":"/paper/2508.03789","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:1e73f0dd1d803c15cf2c8485f5c76dc6ea207413680b28d8e2c3fbfc01f1cd70","observation_id":"ad202311-8bf3-486e-bc24-2de653302391","resolution":{"observed_at":"2026-07-30T23:47:57.932110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.934976Z","title":"Two-frame motion estimation based on polynomial expansion,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.934976Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:aedc7ebc9e3fa7c08ebdfd09df00313b954b38d2596f09583e24f8dc2005a673","observation_id":"94fda894-ad49-4985-a1d3-72c6b679372b","resolution":{"observed_at":"2026-07-30T23:47:57.934976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.937881Z","title":"Chatbot arena: An open platform for evaluating llms by 14 Visko Orbis 1.0 human preference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.937881Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:00749389ed6f317bda4b5b2fa4daed5bf1be15d6b238b74322e36101047cc7d9","observation_id":"323a56c4-c386-4b20-96a8-a84daebe6902","resolution":{"observed_at":"2026-07-30T23:47:57.937881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.940570Z","title":"Happy oyster: Real-time world model for interactive creation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.940570Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:b731314e756dc19926bd703ab290322dbc93d999739af2d2c23f4e8f8b9342dc","observation_id":"4272f78b-c1c1-407d-9164-30dd7859dce6","resolution":{"observed_at":"2026-07-30T23:47:57.940570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.943303Z","title":"Introducing odyssey-2: A general-purpose world model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.943303Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:4a4d0fe3d61e5a363f6db3a2f0db2657b12d0509517dd8335230709c8387446c","observation_id":"6918a66e-f96b-4b25-9008-2499cc034e26","resolution":{"observed_at":"2026-07-30T23:47:57.943303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.945910Z","title":"Pixverse launches r1: A real-time world model that redefines ai video generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.945910Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:f3606057efebfdfd45af1fc87c308ac4045b7bb4c94c82fa5f955db78c41f9c6","observation_id":"9c36116c-b836-46d8-96d6-96ba1bbd9811","resolution":{"observed_at":"2026-07-30T23:47:57.945910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:47:57.806117Z","title":"Available: https://openreview.net/forum?id=2uNlM353RI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.806117Z"},"links":{"citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:c289b2eb62a734b104aad0e118fadf9e187328fb2109c47d1acd560df1415d97","observation_id":"bf1afb5e-4042-4d11-924c-e76ade343271","resolution":{"observed_at":"2026-07-30T23:47:57.806117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T23:40:40.349276Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2607.26694."}