{"as_of":"2026-08-06T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:facc94ecfc6e68b3990f0103b111ffdfdec06ce321cb4eaef0ed0ee8ec6e139a","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:47:13.750039Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17523/citation-record","integrity":"/paper/2607.17523/integrity","json":"/paper/2607.17523/citation-record.json","paper":"/paper/2607.17523"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:04.983265Z","title":"Youtu-llm: Unlocking the native agentic potential for lightweight large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:04.983265Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:27e2055596cce2c246b7a42c7bd9fcde3877562f7b63243b7e5293d32695cfe2","observation_id":"c3b7b776-f939-4895-a031-237815ada913","resolution":{"observed_at":"2026-08-01T17:47:04.983265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-01T17:47:05.062133Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.062133Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:8c8ffff23b76c43fa5f3bd07fe5e9e83967f728edef0acb95ea98544f089d2b5","observation_id":"b268883f-6059-47e9-814b-78ba70662e6f","resolution":{"observed_at":"2026-08-01T17:47:05.062133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:05.183713Z","title":"Sora 2.https://openai.com/index/sora-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.183713Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:e02231a515e9a35e4f241a227f8e153ead5debfa0a1f91e4cd3854fcd6b01785","observation_id":"3362a094-430d-475b-b4a9-73d0ce640b1d","resolution":{"observed_at":"2026-08-01T17:47:05.183713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-08-01T17:47:05.356951Z","title":"Hunyuanvideo 1.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.356951Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3e20ba81f7c18dfbb52a650ae4fd63a7f9d03e1606f273863a85a8eb88cc73a7","observation_id":"92675ba5-d455-41dd-a856-07ad00e3b75d","resolution":{"observed_at":"2026-08-01T17:47:05.356951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:05.530332Z","title":"Veo 3.https://aistudio.google.com/models/veo-3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.530332Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:eb5c516bc4a89c90360ca30fd0b07b45492c2f940930a6baf278fdb079e114e5","observation_id":"6c2d970b-d489-4ddd-ba65-e5a47f9ce6df","resolution":{"observed_at":"2026-08-01T17:47:05.530332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T17:47:05.639163Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.639163Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:2446c8a7315f2e23e5a4aab6d6bf7283862a6f5278306f3c12a44afb4f51b0ba","observation_id":"ea11f366-8280-42aa-bc23-0f5cda6c1acc","resolution":{"observed_at":"2026-08-01T17:47:05.639163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14502","last_updated":"2026-07-23T02:50:21Z","snapshot_observed_at":"2026-08-04T07:54:41.453095Z","submitted_at":"2026-06-12T14:33:55Z","title":"From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14502","snapshot_observed_at":"2026-08-01T17:47:05.751020Z","title":"From chatbot to digital colleague: The paradigm shift toward persistent autonomous ai.arXiv preprint arXiv:2606.14502, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.751020Z"},"links":{"cited_paper":"/paper/2606.14502","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:15737f12eca073bef8c25f13c2cc7c62424a810b8e8f9c3357b2d6fc18641f15","observation_id":"41acdf30-f207-439f-a381-4e6b87a1b8b2","resolution":{"observed_at":"2026-08-01T17:47:05.751020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-01T17:47:05.927225Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.927225Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:b2a05d374c9b8f5781f50cb78176c4eb1407855d3d01cd363e42afc6e1dc284f","observation_id":"6f71d0e0-f3e8-46bc-a99b-beb811933f59","resolution":{"observed_at":"2026-08-01T17:47:05.927225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.134736Z","title":"Understanding world or predicting future? a comprehensive survey of world models.ACM Computing Surveys, 58(3):1–38, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.134736Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:6bcb5ccf25252a214b436cf2fc35b6e1443a4feacaec1a99b8b5555d4564bd38","observation_id":"183adc3c-406c-406f-9150-098284b56556","resolution":{"observed_at":"2026-08-01T17:47:06.134736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-04T19:41:18.206234Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-08-01T17:47:06.272600Z","title":"Videophy-2: A challenging action-centric physical com- monsense evaluation in video generation.arXiv preprint arXiv:2503.06800, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.272600Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:6bd8fd117005d012a84743bce6ba4e466934ccb5e17d31dda9a4f01b70d12b9a","observation_id":"5920ead6-c2f8-48fb-9f7d-3462801e86f6","resolution":{"observed_at":"2026-08-01T17:47:06.272600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.472741Z","title":"The past mistake is the future wisdom: Error-driven contrastive probability optimization for chinese spell checking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.472741Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:b3fd75fb2fb0d066e36643d9b38af1050a1630d30908f5eca6ced8a8e3efe04f","observation_id":"28b0cf78-ac9b-4bb2-842d-17a99a13261c","resolution":{"observed_at":"2026-08-01T17:47:06.472741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.688624Z","title":"Think- ing with video: Video generation as a promising multimodal reasoning paradigm","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.688624Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3412f63edfaf25bf39844fdb7858bb81e9de04ce0c4cf625c98164a40d4281ea","observation_id":"bcf34f7e-8d07-4f11-b174-56cac699311d","resolution":{"observed_at":"2026-08-01T17:47:06.688624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.902542Z","title":"Reasoning via video: The first evaluation of video models’ reasoning abilities through maze-solving tasks.arXiv preprint arXiv:2511.15065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.902542Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:77480901ac8f41684aa6dbde264b6fa31f8721aeaa39c6639ba83e75c2134e5e","observation_id":"79b302f7-46fa-476c-9608-8aaf018b30bb","resolution":{"observed_at":"2026-08-01T17:47:06.902542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.063535Z","title":"Weave: Unleashing and benchmarking the in-context interleaved comprehension and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.063535Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:142b3da0f5724b88e0fc1a38453c0cf21993189c32318a9f737cd2c95c51549a","observation_id":"2849c63f-b004-45be-a2a4-aea3c427aa1b","resolution":{"observed_at":"2026-08-01T17:47:07.063535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.188868Z","title":"Tivibench: Benchmarking think-in-video reasoning for video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.188868Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:68d651cf1b3f4b15614d99610e56246f43cd699686f916f520e79090bb3db0e4","observation_id":"eb068e54-0837-4871-aaad-0c0c9c255731","resolution":{"observed_at":"2026-08-01T17:47:07.188868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.292420Z","title":"Evaluating gemini robotics policies in a veo world simulator.arXiv preprint arXiv:2512.10675, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.292420Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:296003fe8ec58136248d7269c29acca3f7644cfc79062dd811142a11cfb07ccb","observation_id":"df8b54b6-e33e-4890-b847-28dae3b270fa","resolution":{"observed_at":"2026-08-01T17:47:07.292420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.399742Z","title":"Ggbench: A geometric generative reasoning benchmark for unified multimodal models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.399742Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:6783135ba71516815877e2584ae0ce3931aa7cb26545081a3d79cd744a833935","observation_id":"340e3464-76b5-4ebb-8910-eeda2658bb8a","resolution":{"observed_at":"2026-08-01T17:47:07.399742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.550254Z","title":"Let’s think with images efficiently! an interleaved-modal chain-of-thought reasoning framework with dynamic and precise visual thoughts","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.550254Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:05a9fde621e64563b884f4088d62635858f86a915e852a37c40dcb1828284007","observation_id":"c588afa7-58f2-49db-bfbf-e07be89a9d08","resolution":{"observed_at":"2026-08-01T17:47:07.550254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.733004Z","title":"Physgen: Rigid-body physics-grounded image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.733004Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:36a7ffd21c231859081ff2d1fc70c9ae8d6a7c4fb20b5e3499f5090aa9d460b5","observation_id":"7c54f164-3993-4179-9b48-475a6b2ee650","resolution":{"observed_at":"2026-08-01T17:47:07.733004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21765","last_updated":"2025-03-27T17:58:33Z","snapshot_observed_at":"2026-07-06T20:59:49.523414Z","submitted_at":"2025-03-27T17:58:33Z","title":"Exploring the Evolution of Physics Cognition in Video Generation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21765","snapshot_observed_at":"2026-08-01T17:47:07.906970Z","title":"Exploring the evolution of physics cognition in video generation: A survey.arXiv preprint arXiv:2503.21765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.906970Z"},"links":{"cited_paper":"/paper/2503.21765","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:f3ebf91165c14a7f19b6c325eba8b91e130b46b87350e9ab7168172a3b62eaea","observation_id":"4e7da424-a68d-4c27-8ee9-6419c9091ffb","resolution":{"observed_at":"2026-08-01T17:47:07.906970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.045401Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.045401Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:dfee4ca79c8c593e05e2dd8db0ce81198c0760c41881088c77d5809933e0c92b","observation_id":"2d7942be-06a5-4a8f-8624-74c3ee6f3621","resolution":{"observed_at":"2026-08-01T17:47:08.045401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.215955Z","title":"FVD: A new metric for video generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.215955Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:b2e61c447536e2f981a99ba2f5a13d60ee1e93ba69c14712674618a14c35231d","observation_id":"4384fc51-e1a3-477b-8302-9fe4f393075b","resolution":{"observed_at":"2026-08-01T17:47:08.215955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.494735Z","title":"On the content bias in fréchet video distance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.494735Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:ee4d5708475b07654bfb2a38784cb8ef068dc01c8fac5f2f2b8f7339d18477df","observation_id":"4bbd32dc-1b98-4c46-bbe5-53e1ca6f2694","resolution":{"observed_at":"2026-08-01T17:47:08.494735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06665","last_updated":"2024-04-29T23:21:33Z","snapshot_observed_at":"2026-07-06T17:28:10.554625Z","submitted_at":"2024-02-06T17:15:33Z","title":"The Essential Role of Causality in Foundation World Models for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06665","snapshot_observed_at":"2026-08-01T17:47:08.632064Z","title":"The essential role of causality in foundation world models for embodied ai.arXiv preprint arXiv:2402.06665, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.632064Z"},"links":{"cited_paper":"/paper/2402.06665","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:d587833ffad8f7d4fe8af2ed800c15e4870aa6aae06100a39d9952e129b8f9dd","observation_id":"0993dd37-f5d0-4ae7-a738-2c0c41d2a414","resolution":{"observed_at":"2026-08-01T17:47:08.632064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.796963Z","title":"Diffusion art or digital forgery? investigating data replication in diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.796963Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:876b81221d05cfeb11c1e3346c8cb7aa1dc32175bb43a6273cd70093a4d5e460","observation_id":"f4d139b7-71ad-4e7d-a290-2d3d1a41e8fd","resolution":{"observed_at":"2026-08-01T17:47:08.796963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.955102Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.955102Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:7b35c59f08d23794519b0794da7b1b010d1e7fb91babe59d45b31421157d497f","observation_id":"8d3fbe95-ac2c-4864-9de3-afdfa3d18455","resolution":{"observed_at":"2026-08-01T17:47:08.955102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.107864Z","title":"Do generative video models understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 948–958, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.107864Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:d79c677310f0a9580e4984d8c6286afe3117120c0c2f22d362f393310ed03a44","observation_id":"346eedb5-5d52-47ae-8da8-8821aa4496aa","resolution":{"observed_at":"2026-08-01T17:47:09.107864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03821","last_updated":"2026-05-05T14:49:00Z","snapshot_observed_at":"2026-07-06T23:16:40.201701Z","submitted_at":"2026-05-05T14:49:00Z","title":"RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03821","snapshot_observed_at":"2026-08-01T17:47:09.268892Z","title":"Roboalign-r1: Distilled multimodal reward alignment for robot video world models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.268892Z"},"links":{"cited_paper":"/paper/2605.03821","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:54d05ba978cb2bb1f0e572e806de57464374fce26eba9faa9a154ebd18dc8577","observation_id":"681bab52-da7f-4f80-8208-920d355eba84","resolution":{"observed_at":"2026-08-01T17:47:09.268892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.423659Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.423659Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:72b0ebdd7cc77cbeed5ad54eaac52c61d6050ce2e371b421a51a67d26878ac1d","observation_id":"7cfdd990-47cb-419e-9141-1f8aba064fdb","resolution":{"observed_at":"2026-08-01T17:47:09.423659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.568545Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.568545Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:d184a48f7f9cbfff374c0840a2a3e3f13d21d3c36426d47ac90b4dbc26eb4b92","observation_id":"b03da153-1e28-4dde-80d4-d80e60feac85","resolution":{"observed_at":"2026-08-01T17:47:09.568545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.717609Z","title":"Video generation models as world simulators.OpenAI Blog, 1(8):1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.717609Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:c895f0299a0405c9c2f37c5765531a6821a2f56e1008017cbe8131ae78e42e9a","observation_id":"d16d4994-edc7-486f-8ca0-c70b18120e6d","resolution":{"observed_at":"2026-08-01T17:47:09.717609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.883305Z","title":"What about gravity in video generation? post-training newton’s laws with verifiable rewards.arXiv preprint arXiv:2512.00425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.883305Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:b50d32418e5e080000db9c64040f04114fce23a6b762d91109156928874c8c73","observation_id":"cfbbbf81-aae1-4bb4-8f0c-b48111c36c11","resolution":{"observed_at":"2026-08-01T17:47:09.883305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.028648Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to- video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.028648Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:d1681bf7ca5f4b0fc7aed5bb50ab19620e535f4690872779d526fe310ffeb683","observation_id":"f1606849-161b-4dde-92ac-bcd5521a617c","resolution":{"observed_at":"2026-08-01T17:47:10.028648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.192580Z","title":"Vibe: A text-to-video benchmark for evaluating hal- lucination in large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.192580Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:b656609ea7f86d2ab50e41826723d61d32131f36291f96f53a24a55791300607","observation_id":"81b672e5-e006-454e-9c39-3baadfdbd46b","resolution":{"observed_at":"2026-08-01T17:47:10.192580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-01T17:47:10.369130Z","title":"World models.arXiv preprint arXiv:1803.10122, 2(3), 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.369130Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:2f4ff9b7aecd6461a8f538d2a6254eeeb65f89c1a07ea3f029aa7a74dfe4d7e1","observation_id":"6005acd2-3838-4655-b5b2-f94ef9c5749b","resolution":{"observed_at":"2026-08-01T17:47:10.369130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.488113Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.488113Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:054237912301b485ade4ef25b6f9b6949795a998a92e523e1d9d08b686b012ec","observation_id":"865b148a-0639-4b83-bed5-70275e86a37e","resolution":{"observed_at":"2026-08-01T17:47:10.488113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08003","last_updated":"2025-04-09T16:10:15Z","snapshot_observed_at":"2026-08-05T14:51:16.694966Z","submitted_at":"2025-04-09T16:10:15Z","title":"Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08003","snapshot_observed_at":"2026-08-01T17:47:10.650083Z","title":"Have we unified image generation and understanding yet? an empirical study of gpt-4o’s image generation ability.arXiv preprint arXiv:2504.08003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.650083Z"},"links":{"cited_paper":"/paper/2504.08003","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:d27e7b6f3928fafebe42ebd8400dc7b55d89d26ee9883658b1c92208fb7fb841","observation_id":"1fe3a9cc-1e28-4c26-bd81-91db74b9caa6","resolution":{"observed_at":"2026-08-01T17:47:10.650083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.778104Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.778104Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:1d03bca4286e617a6fe1568aedc7167362f764557f29f7dad5ffa2e21cc1c0d7","observation_id":"bdc30d75-403e-4271-bb63-5728bbb293b0","resolution":{"observed_at":"2026-08-01T17:47:10.778104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.959513Z","title":"The sound of water: Inferring physical properties from pouring liquids","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.959513Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:2409e0325ada2980df81133bc03392b9dc251d99f3af34171577331f50657371","observation_id":"6d7ff8a3-ca4f-4be4-a1bd-f9fb1fdcd440","resolution":{"observed_at":"2026-08-01T17:47:10.959513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-01T17:46:40.019621Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-08-01T17:47:11.071407Z","title":"Physion: Evaluating physical prediction from vision in humans and machines","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.071407Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:df790656cb4e6a9b4db8958899195927d43bf68d31e49e0e564b4609b55508cc","observation_id":"e1672087-e3a2-4a30-8032-89efe9002863","resolution":{"observed_at":"2026-08-01T17:47:11.071407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02508","last_updated":"2024-09-04T08:08:21Z","snapshot_observed_at":"2026-08-05T19:11:47.187766Z","submitted_at":"2024-09-04T08:08:21Z","title":"TLD: A Vehicle Tail Light signal Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02508","snapshot_observed_at":"2026-08-01T17:47:11.177637Z","title":"Tld: A vehicle tail light signal dataset and benchmark.arXiv preprint arXiv:2409.02508, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.177637Z"},"links":{"cited_paper":"/paper/2409.02508","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:0ef49dea6ea7c7385551163fdec93572d2819d4b264ea42e4b1896c4ca56a922","observation_id":"56746adb-4ee7-424c-b99f-fe235f2ce35d","resolution":{"observed_at":"2026-08-01T17:47:11.177637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-01T17:47:11.299311Z","title":"The kinetics human action video dataset.arXiv preprint arXiv:1705.06950, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.299311Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:c462f72a30e64166620c729c808cde7176d9c931f78c2177b0eee57e0c79ae73","observation_id":"3119fe02-6076-421d-8623-8fb47675dd61","resolution":{"observed_at":"2026-08-01T17:47:11.299311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:11.456060Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.456060Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:69d700a785141add463b9749d67f9e1004766a8c6cc8aa18cfecce2b2c6a71db","observation_id":"0f149436-6454-4854-ba04-5fbd4a2ec778","resolution":{"observed_at":"2026-08-01T17:47:11.456060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-01T17:47:11.624753Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.624753Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:12f36e0df8f448cb6b5087b894fe7e801cd130277d9c6f073c3a05980f73af41","observation_id":"0c291af9-b8e3-4bc6-b573-09e9e32aa427","resolution":{"observed_at":"2026-08-01T17:47:11.624753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:11.737381Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.737381Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:243e584ec8b3ed8265b4771dc00cf047943e193f0563710c449cd9fac7416758","observation_id":"7c66c50e-c190-47bc-94e1-ae62a2776045","resolution":{"observed_at":"2026-08-01T17:47:11.737381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T17:47:11.848598Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.848598Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:fc4c604daae67080f49a9c74a4fc72c494ae113011d2fd1888655d8df1dab5a1","observation_id":"bb04f007-3916-4d36-9401-c8711314876a","resolution":{"observed_at":"2026-08-01T17:47:11.848598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-01T17:47:11.966954Z","title":"Openai gpt-5 system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.966954Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3d3d1b41e67c0ef6cdf906ad5b5790cceb732734ce2cd676f309609ca474a63a","observation_id":"289c7a03-9513-4594-ae01-e88413b45fc5","resolution":{"observed_at":"2026-08-01T17:47:11.966954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.088675Z","title":"Scaling zero-shot reference-to-video generation.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.088675Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:9a7b94a29ad9aacebf88bbf2337915ef85543a8a33684365ce644e1596818bac","observation_id":"a6f56fdd-2510-4055-8df2-90eceae09a42","resolution":{"observed_at":"2026-08-01T17:47:12.088675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04678","snapshot_observed_at":"2026-08-01T17:47:12.237328Z","title":"Reward forcing: Efficient streaming video generation with rewarded distribution matching distillation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.237328Z"},"links":{"cited_paper":"/paper/2512.04678","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:dd980bbf331c0b87ee2cb5457f3a9974ba744ce0445b4dc274c10a5555a01a8c","observation_id":"4917b50f-6f35-4b29-a0d0-58d904216787","resolution":{"observed_at":"2026-08-01T17:47:12.237328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.350191Z","title":"Stable video infinity: Infinite-length video generation with error recycling.arXiv preprint arXiv:2510.09212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.350191Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:8dfbf42b298e33f49cfd3b366d23a93888d96b5410c5651cfae7cec21312b7db","observation_id":"f2523d10-3c97-4cc1-bb65-31af0cb879ce","resolution":{"observed_at":"2026-08-01T17:47:12.350191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-08-01T17:47:12.458101Z","title":"thinking with long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.458101Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:0290fc4e1ec9ad51610689f8ca91e949de8295605f1ec62489d9c7227a7dda7d","observation_id":"5f57e935-e817-4ec8-8ad7-79753866fcaa","resolution":{"observed_at":"2026-08-01T17:47:12.458101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.611214Z","title":"V-reasonbench: Toward unified reasoning benchmark suite for video generation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.611214Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:5641d458d6f92cd21dd3cd4eb1ff24fe5885edbb0c4bb8520e583880acd8f7f7","observation_id":"349359b0-731f-4220-8f57-5b05ee3c02d4","resolution":{"observed_at":"2026-08-01T17:47:12.611214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.825883Z","title":"Vitcot: Video-text interleaved chain-of-thought for boosting video understanding in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.825883Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:0a71c7912d0a8b0d6211c77bf72152cb3935d158df2ff7437ae9694cbde2ef7c","observation_id":"27ab5293-97ed-488f-9cb7-7bcc0a468d3a","resolution":{"observed_at":"2026-08-01T17:47:12.825883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.956508Z","title":"Ruler-bench: Probing rule-based reasoning abilities of next-level video generation models for vision foundation intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.956508Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:c31d9348346dd1a7d522720032605a1e6fc41e4974d2a7c2f71a1566ede3f39a","observation_id":"2fc1c363-0dc2-4bfa-a372-cdecc44e767f","resolution":{"observed_at":"2026-08-01T17:47:12.956508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.071487Z","title":"Can world simulators reason? gen-vire: A generative visual reasoning benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.071487Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:9fcb06cb5b6a0e891e1e870ac4e66f6d521fbafddae52f1711061f616f673d32","observation_id":"542dec33-ec6a-4828-b0a5-1c969dd8ed89","resolution":{"observed_at":"2026-08-01T17:47:13.071487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.292641Z","title":"CCHall: A novel benchmark for joint cross-lingual and cross- modal hallucinations detection in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.292641Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:910a60adad01aee4e2b504f78ba26651b78624fbcfac2b8fcb7940b31ca18d6f","observation_id":"8d8fd854-c9e1-49ed-a6c3-6e3595abf3dc","resolution":{"observed_at":"2026-08-01T17:47:13.292641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.421131Z","title":"Large language models meet nlp: A survey.Frontiers of Computer Science, 20(11):2011361, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.421131Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:77eecc1841e3e0f528cf56234c974fb397ab03eba324a29428f2a5cc005dbe8f","observation_id":"6d0f5da2-5c50-4887-a9a1-c7fd7163c42a","resolution":{"observed_at":"2026-08-01T17:47:13.421131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.478604Z","title":"Are video models ready as zero-shot reasoners? an empirical study with the mme-cof benchmark.arXiv preprint arXiv:2510.26802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.478604Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:c36c3713302d0a25e81249a4be3fe534ae7126f965b4afd808df3dad81b975a4","observation_id":"dcc1aacd-a901-45d8-a871-ea3b0a1777c7","resolution":{"observed_at":"2026-08-01T17:47:13.478604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.365314Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.365314Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:7c8a28d5ab1c73badc7c816a652d8c06e131da0ae8b4346b96b7bf0248ec1ddd","observation_id":"ba003690-3d5e-4339-81a0-d116a936937c","resolution":{"observed_at":"2026-08-01T17:47:13.365314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02607","last_updated":"2026-07-01T13:51:02Z","snapshot_observed_at":"2026-07-12T09:09:14.587474Z","submitted_at":"2026-07-01T13:51:02Z","title":"Latent Visual Cache for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02607","snapshot_observed_at":"2026-08-01T17:47:13.597841Z","title":"Latent visual cache for video reasoning.arXiv preprint arXiv:2607.02607, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.597841Z"},"links":{"cited_paper":"/paper/2607.02607","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:76c593d61f4d4a40346c079c1bf42d87890e31235b8d7939ae77a78e892b1071","observation_id":"30cf12d7-beed-4d12-9caa-a1ba8ba98eb2","resolution":{"observed_at":"2026-08-01T17:47:13.597841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.651779Z","title":"Mmgr: Multi-modal generative reasoning.arXiv preprint arXiv:2512.14691, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.651779Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:1938f5e13f1381a89cf92f7fd0dc92848a07b74591c1462eab56db57e2378b78","observation_id":"e985d63c-cca1-4f9b-9f41-16b1dcd9e458","resolution":{"observed_at":"2026-08-01T17:47:13.651779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.540223Z","title":"Video models start to solve chess, maze, sudoku, mental rotation, and raven’matrices.arXiv preprint arXiv:2512.05969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.540223Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:747a551bece9ab21745f02779ec1d9d4e82ff9d5b1b9e8d2391faa384ba8c43c","observation_id":"38e2166c-e519-4414-a023-a8ccac217909","resolution":{"observed_at":"2026-08-01T17:47:13.540223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.750039Z","title":"Beyond the last frame: Process-aware evaluation for generative video reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.750039Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:9074fc8a7a4c50ac4300fcc9e8000f0ef959af8c3f083ec683af41cfba8fc784","observation_id":"307fd135-8114-41b9-a092-782e9b338d94","resolution":{"observed_at":"2026-08-01T17:47:13.750039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.331772Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.331772Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:f9450c138140ed03f537611af62f7da301af84c80f8a97ff3a64d626cc930bb9","observation_id":"605f4c84-aa7a-48b6-9c5d-73b0fd3f4a94","resolution":{"observed_at":"2026-08-01T17:47:08.331772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.188710Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.188710Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:1e123ef1ce8a39459b691a8ad5622dcff37802df80d185fa6a89da3ec9338a81","observation_id":"179ec37e-e83d-4301-9e90-1933f2fb7440","resolution":{"observed_at":"2026-08-01T17:47:13.188710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T19:35:40.615943Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.17523."}