{"as_of":"2026-08-09T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2a820c6afdc5476deaa2524709e6538f5871a30c9c2711fae9a42e7097c011d","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T13:09:35.981096Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27036/citation-record","integrity":"/paper/2607.27036/integrity","json":"/paper/2607.27036/citation-record.json","paper":"/paper/2607.27036"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.08544","last_updated":"2025-11-14T08:38:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-11T18:21:55Z","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.08544","snapshot_observed_at":"2026-07-30T13:09:35.542295Z","title":"Lejepa: Provable and scalable self-supervised learning with- out the heuristics.arXiv preprint arXiv:2511.08544,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.542295Z"},"links":{"cited_paper":"/paper/2511.08544","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:a6fd58e18797e004da2b7ad5ab511835d46e170869345fb2784af35f2bf37e14","observation_id":"e7d44bbe-f3eb-4543-9990-6f66f27d4d06","resolution":{"observed_at":"2026-07-30T13:09:35.542295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03572","last_updated":"2025-04-11T19:20:22Z","snapshot_observed_at":"2026-08-06T18:01:55.599924Z","submitted_at":"2024-12-04T18:59:45Z","title":"Navigation World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03572","snapshot_observed_at":"2026-07-30T13:09:35.549305Z","title":"Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, and Yann LeCun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.549305Z"},"links":{"cited_paper":"/paper/2412.03572","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:d31f8cc8f11f4cbd1c08a5a3129a1909ac67f40c977fbe5fb9ca8182227134a7","observation_id":"c1e9c168-1385-4f3e-9280-73977f94de49","resolution":{"observed_at":"2026-07-30T13:09:35.549305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15689","last_updated":"2026-05-06T21:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-20T09:07:36Z","title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15689","snapshot_observed_at":"2026-07-30T13:09:35.569303Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.569303Z"},"links":{"cited_paper":"/paper/2412.15689","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:25a55dc022767b08224d3d48efc35319a689615608c3dc66bd0167af9457db86","observation_id":"f7707265-aef6-4426-92ed-4f0a25fc3107","resolution":{"observed_at":"2026-07-30T13:09:35.569303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:35.577926Z","title":"Pre-trained language model representations for language generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.577926Z"},"links":{"citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:00a62f21db42ad9448728cc1549787d2552d951bdc0bf382c9f474b63c9927ec","observation_id":"72aa4d30-974b-4edd-a36d-204674dbea1e","resolution":{"observed_at":"2026-07-30T13:09:35.577926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.13440","last_updated":"2019-07-29T18:10:30Z","snapshot_observed_at":"2026-07-06T08:11:28.806130Z","submitted_at":"2019-07-29T18:10:30Z","title":"MineRL: A Large-Scale Dataset of Minecraft Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.13440","snapshot_observed_at":"2026-07-30T13:09:35.590051Z","title":"Minerl: A large-scale dataset of minecraft demonstrations","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.590051Z"},"links":{"cited_paper":"/paper/1907.13440","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:588d01cb516bd7e7b3956434471fcec8c899fcbe01674f72854a87990178b020","observation_id":"2cfa8645-05de-444f-942e-29cd67afae8d","resolution":{"observed_at":"2026-07-30T13:09:35.590051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-07-30T13:09:35.617774Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation with transformers.arXiv preprint arXiv:2205.15868,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.617774Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:d5795d0592fb5876eab1ae5c35c1085f5b7f6f85abee3f3f7cfab4ec56634090","observation_id":"c908fad0-b6bc-48aa-9e2a-f802fc04bc78","resolution":{"observed_at":"2026-07-30T13:09:35.617774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-30T13:09:35.624634Z","title":"Gaia-1: A generative world model for autonomous driving.arXiv preprint arXiv:2309.17080,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.624634Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:f459bf36f5109df1b5565c60d5b1acebc24158e6dc68a6209a27295aa6f6182d","observation_id":"b6b2dd56-3fde-4ed6-a669-9fb82948fdbc","resolution":{"observed_at":"2026-07-30T13:09:35.624634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:35.632980Z","title":"Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, and Zhouchen Lin","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.632980Z"},"links":{"citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:2ed7dfaf564b6f4cdf4d8697e4dba1d47b60c22d8318c66bc2c8c345113d8e1a","observation_id":"4f9864d8-9707-4790-8746-dae35c25a2fd","resolution":{"observed_at":"2026-07-30T13:09:35.632980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:35.639932Z","title":"URLhttps://proceedings.neurips.cc/paper_files/paper/ 2024/file/e304d374c85e385eb217ed4a025b6b63-Paper-Conference.pdf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.639932Z"},"links":{"citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:516d5ffb0ab741e05133dd5e9e4e442d4b4c79d09e4fe49de368a30c393f51e0","observation_id":"bfaae049-88be-449f-8811-556737900834","resolution":{"observed_at":"2026-07-30T13:09:35.639932Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-07-30T13:09:35.645585Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation.arXiv preprint arXiv:2508.05635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.645585Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:0c8527295aefb9409f7bf75e7e4348de66707f5c88f4262fd686d001391a7fd7","observation_id":"cac93e91-c435-4b80-bbf8-8730a60a296c","resolution":{"observed_at":"2026-07-30T13:09:35.645585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19312","last_updated":"2026-06-03T18:50:40Z","snapshot_observed_at":"2026-08-06T05:42:53.129146Z","submitted_at":"2026-03-13T19:48:14Z","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19312","snapshot_observed_at":"2026-07-30T13:09:35.650949Z","title":"Leworld- model: Stable end-to-end joint-embedding predictive architecture from pixels.arXiv preprint arXiv:2603.19312,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.650949Z"},"links":{"cited_paper":"/paper/2603.19312","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:ee6dd4773e23917e936f9fb55c3c05fefe536ac67d9b5093b6be146b632bb063","observation_id":"da4ff7fc-4b49-40fd-8690-8a8370701303","resolution":{"observed_at":"2026-07-30T13:09:35.650949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-07-30T13:09:35.684747Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.684747Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:9fb6fe54d78417986ff43bfdf7eb1d685ccde68e9a9b16b8ad8cc87cec205d98","observation_id":"33320717-a92a-4917-8568-30419176d014","resolution":{"observed_at":"2026-07-30T13:09:35.684747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21819","last_updated":"2025-05-27T23:02:54Z","snapshot_observed_at":"2026-08-07T13:20:29.152484Z","submitted_at":"2025-05-27T23:02:54Z","title":"Representative Language Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21819","snapshot_observed_at":"2026-07-30T13:09:35.734743Z","title":"Charlotte Peale, Vinod Raman, and Omer Reingold","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.734743Z"},"links":{"cited_paper":"/paper/2505.21819","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:7d3286d8e4a793093e75747dc2980ac8bd395bfa3a758de9fb6dcd76652e4137","observation_id":"082b2ace-c474-48e5-853f-c0f329e986ea","resolution":{"observed_at":"2026-07-30T13:09:35.734743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:35.774781Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.774781Z"},"links":{"citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:16e58fd0c518deab66706e87cd66a2b2e001b7b42100e7d64b5f1e972f9117fc","observation_id":"4bc04e04-7e83-45e0-87ec-a3979fb9dc6d","resolution":{"observed_at":"2026-07-30T13:09:35.774781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-07T04:54:23.914784Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-07-30T13:09:35.844757Z","title":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.844757Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:d46b8b73d3efd7c80fd2914dec0cdd343b819c4b5256d4dc8db463f49a8fdbe5","observation_id":"aa843729-8093-4aa9-b6f8-64a2664689ec","resolution":{"observed_at":"2026-07-30T13:09:35.844757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-30T13:09:35.884739Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.884739Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:02cfb14ade9cf439f2add1c674c50b2c456a4da32df8e612bb8ae50c3831c2cd","observation_id":"46bbb23f-8ac6-4a0f-8491-feb67b5a1c6d","resolution":{"observed_at":"2026-07-30T13:09:35.884739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-07T11:01:49.684719Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-07-30T13:09:35.904126Z","title":"Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, and Yunfeng Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.904126Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:7d99ba10d040f45c64aff3c339422de3395f834db2db545587f3d054c5552fe9","observation_id":"4c8bb7bf-335b-447d-8a20-6165804242ac","resolution":{"observed_at":"2026-07-30T13:09:35.904126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-07-30T13:09:35.911015Z","title":"Diffusion models are real-time game engines.arXiv preprint arXiv:2408.14837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.911015Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:15308038da2639073379345ee5df0092cde2e90cb43dd557b383c8f0aa43a313","observation_id":"abb2848c-d03d-4805-b925-864a464a1da5","resolution":{"observed_at":"2026-07-30T13:09:35.911015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-30T13:09:35.922005Z","title":"Mod- elscope text-to-video technical report.arXiv preprint arXiv:2308.06571,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.922005Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:d7e78daab7c9da0ab2c80f0f791fae188300766ffd901def9a25a83228248988","observation_id":"2a49ca13-aafa-461d-97bf-d7733f5cfce6","resolution":{"observed_at":"2026-07-30T13:09:35.922005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09027","last_updated":"2025-07-24T15:55:00Z","snapshot_observed_at":"2026-08-08T15:14:26.502885Z","submitted_at":"2025-06-10T17:53:29Z","title":"Diffuse and Disperse: Image Generation with Representation Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09027","snapshot_observed_at":"2026-07-30T13:09:35.929865Z","title":"Wenming Weng, Ruoyu Feng, Yanhui Wang, Qi Dai, Chunyu Wang, Dacheng Yin, Zhiyuan Zhao, Kai Qiu, Jianmin Bao, Yuhui Yuan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.929865Z"},"links":{"cited_paper":"/paper/2506.09027","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:08df71aaa00d47548699142f6523a02b58cc00d6c0842958a400a366fa996cac","observation_id":"6743bc7c-44a3-49cc-aac1-599fcd5478eb","resolution":{"observed_at":"2026-07-30T13:09:35.929865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08151","last_updated":"2025-05-18T06:43:40Z","snapshot_observed_at":"2026-08-06T10:06:06.704733Z","submitted_at":"2024-10-10T17:36:15Z","title":"Progressive Autoregressive Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08151","snapshot_observed_at":"2026-07-30T13:09:35.936709Z","title":"Progressive autoregressive video diffusion models.arXiv preprint arXiv:2410.08151,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.936709Z"},"links":{"cited_paper":"/paper/2410.08151","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:fcd8949c7c6190c5c082b28c978372789454f1218a2458246846a3a9f5b454dd","observation_id":"071d8046-9fa8-4a2e-9dd2-79fd8c6b2d1b","resolution":{"observed_at":"2026-07-30T13:09:35.936709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-30T13:09:35.942835Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.942835Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:96185770f64e847f22f524c1e29126c1cb411bcbf34c4b55299b617c368ad4d4","observation_id":"c407142e-4449-4333-ad9d-1eb333f46729","resolution":{"observed_at":"2026-07-30T13:09:35.942835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:35.952665Z","title":"Gamefactory: Creating new games with generative interactive videos.arXiv preprint arXiv:2501.08325, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.952665Z"},"links":{"citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:e92a8adc77a68cd29b9eaa13bee3ff7855839bb7f621c1ff0f56aa517362377e","observation_id":"fbc31150-b2c4-41ba-9e95-76274a060ffb","resolution":{"observed_at":"2026-07-30T13:09:35.952665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:35.965615Z","title":"13 A Preprint Boyang Zheng, Nanye Ma, Shengbang Tong, and Saining Xie","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.965615Z"},"links":{"citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:e149ac36926ef7d302ca798bf34cd4d3c8fe07e0a266db738bc3ee9ffe9aa13f","observation_id":"8c8aa7d6-cd78-4983-87f8-bafd509edfae","resolution":{"observed_at":"2026-07-30T13:09:35.965615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-30T13:09:35.971697Z","title":"Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, and Yang You","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.971697Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:6bb94976c07defcc9324a68958948ae72b0bf7e6db13976c43f91343e27de07f","observation_id":"ccfab96b-c440-4f63-8fa9-9a5d48a6d903","resolution":{"observed_at":"2026-07-30T13:09:35.971697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04983","snapshot_observed_at":"2026-07-30T13:09:35.981096Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.981096Z"},"links":{"cited_paper":"/paper/2411.04983","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:083ed3f60f03ba699c77fd2063bc4fde5e3c2c765eb3f7ce2b1c3e7f8ed49dae","observation_id":"e57ae3e6-5878-4652-9e3f-ef6272308e7e","resolution":{"observed_at":"2026-07-30T13:09:35.981096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11495","last_updated":"2022-12-15T20:57:59Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:51:48Z","title":"Flexible Diffusion Modeling of Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11495","snapshot_observed_at":"2026-07-30T13:09:35.601823Z","title":"Flexible diffusion modeling of long videos.arXiv preprint arXiv:2205.11495,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.601823Z"},"links":{"cited_paper":"/paper/2205.11495","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:e811d19cd8fe660cf06e99c3482eede5ee5cdb00dba3c78f0dc82b1a8dd770b9","observation_id":"e978b968-a126-445f-93ee-deb7bc5f3efe","resolution":{"observed_at":"2026-07-30T13:09:35.601823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-07-30T13:09:35.596156Z","title":"World models.arXiv preprint arXiv:1803.10122,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.596156Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:f4ee4122ee76aa825bb2ac1753786655224b321e49f7725ec72df963e50446d3","observation_id":"38230e96-c332-4e24-a8bd-e6a55f3d8e64","resolution":{"observed_at":"2026-07-30T13:09:35.596156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-07-30T13:09:35.610850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.610850Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:8272aa549ec3866da77ccbe8d923c1e2a1981619eb53b13826216067c5027a62","observation_id":"ba1694d6-fda1-4ea4-ae2c-594ce443d94b","resolution":{"observed_at":"2026-07-30T13:09:35.610850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:35.583674Z","title":"Junliang Guo, Yang Ye, Tianyu He, Haoyu Wu, Yushu Jiang, Tim Pearce, and Jiang Bian","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.583674Z"},"links":{"citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:46a971c9d411d3d12d840cbe5e01ed299085f4010e095e35940754c53dc556f3","observation_id":"8d550b77-a1fd-4f98-b0a9-dd1a9ad82c1f","resolution":{"observed_at":"2026-07-30T13:09:35.583674Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-07-30T13:09:35.555769Z","title":"Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram V oleti, Adam Letts, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.555769Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:0afcd3e524e6c612f760806728ad0e4752dc6bca888caef55f434ebac0c1dc00","observation_id":"4682cbba-a32e-4fd2-b7f0-0d0a203d2913","resolution":{"observed_at":"2026-07-30T13:09:35.555769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-07-30T13:09:35.533052Z","title":"Alisson Azzolini, Hannah Brandon, Prithvijit Chattopadhyay, Huayu Chen, Jinju Chu, Yin Cui, Jenna Diamond, Yifan Ding, Francesco Ferroni, Rama Govindaraju, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.533052Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:9f0b69276a1f4de4aa28c85bc50a04441fb0c1f55b166299fec754d460c74b70","observation_id":"c431b515-135f-4a46-a51b-11c5a6b7bd51","resolution":{"observed_at":"2026-07-30T13:09:35.533052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-02T07:40:05.046770Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-07-30T13:09:35.561958Z","title":"Self-forcing++: Towards minute-scale high-quality video generation.arXiv preprint arXiv:2510.02283,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-30T13:09:35.561958Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2607.27036"},"observation_digest":"sha256:c9bebedbcfdc881ab316b5d5ed70749cdbda031c704f88ae881230846fd1aa60","observation_id":"0f13f13f-81df-4bd2-82e3-57338cefa2c0","resolution":{"observed_at":"2026-07-30T13:09:35.561958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27036","last_updated":"2026-07-29T15:29:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T09:32:48.004837Z","submitted_at":"2026-07-29T15:29:39Z","title":"Mitigating Compounding Error via Video Representation Regularization"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.27036."}