{"as_of":"2026-08-10T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0197f543076a11f087ae7e878df98754901de9e8577b793e59f7dd6e5011faa","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:34:01.740152Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:24:28.926512Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T22:26:17.260644Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":"2603.16870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-07-01T22:26:17.260644Z","title":"Demystifing video reasoning","venue":"cs.CV","work_id":"3c1e0496-b6e9-481a-bced-29c25a6ed25f","year":2026},"citing_paper":{"arxiv_id":"2605.09693","last_updated":"2026-05-10T18:25:52Z","snapshot_observed_at":"2026-08-03T00:00:10.613016Z","submitted_at":"2026-05-10T18:25:52Z","title":"Do multimodal models imagine electric sheep?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T03:24:01.933339Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2605.09693"},"observation_digest":"sha256:7be922ca82b3e5909cea61c1bcebd5907d9a8246f9544dc6b55d278b8729a51a","observation_id":"41a988b5-909d-4a01-87d5-ba45aa6f9e3f","resolution":{"observed_at":"2026-05-27T02:05:13.880714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":"2603.16870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-07-01T22:26:17.260644Z","title":"Demystifing video reasoning","venue":"cs.CV","work_id":"3c1e0496-b6e9-481a-bced-29c25a6ed25f","year":2026},"citing_paper":{"arxiv_id":"2605.15458","last_updated":"2026-05-14T22:40:56Z","snapshot_observed_at":"2026-08-01T23:49:14.751351Z","submitted_at":"2026-05-14T22:40:56Z","title":"Video Models Can Reason with Verifiable Rewards","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T15:03:14.894952Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2605.15458"},"observation_digest":"sha256:23cfade9473a4223462ffd9f8ba271e6d7ecd4be63a77a2d60f74598ee12f423","observation_id":"ae335b51-2285-4a55-8cf5-7468b845d319","resolution":{"observed_at":"2026-05-27T02:05:13.880714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":"2603.16870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-07-01T22:26:17.260644Z","title":"Demystifing video reasoning","venue":"cs.CV","work_id":"3c1e0496-b6e9-481a-bced-29c25a6ed25f","year":2026},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:3dee4d6d5ef5f69cba20ceb62ada1c75ce96523c4cb84c33cf85a6cad0caf5b0","observation_id":"bdde8ebd-63b9-4e90-a23c-a3ec92fa1b4e","resolution":{"observed_at":"2026-07-01T22:26:17.262860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":"2603.16870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-07-01T22:26:17.260644Z","title":"Demystifing video reasoning","venue":"cs.CV","work_id":"3c1e0496-b6e9-481a-bced-29c25a6ed25f","year":2026},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:140f316a6f4d9da526ccfb1ffda49c0fbc10ace1e6e4ab5474d528a97ad8ce2a","observation_id":"522a6245-66ba-4160-b948-fb59ee29d99c","resolution":{"observed_at":"2026-06-30T10:44:36.848444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-08-01T11:24:28.926512Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19919","last_updated":"2026-07-22T08:50:40Z","snapshot_observed_at":"2026-08-02T12:24:58.302184Z","submitted_at":"2026-07-22T08:50:40Z","title":"Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:24:28.926512Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2607.19919"},"observation_digest":"sha256:66f4e104cb03db6b6837bc97ede9dd2f65d607c0ef2285601aaa92c2a7a1cce4","observation_id":"92abe9cd-18cb-4901-9e05-57beaba17782","resolution":{"observed_at":"2026-08-01T11:24:28.926512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-08-01T03:02:03.269966Z","title":"Demystifing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-10T14:39:39.683275Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:03.269966Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:a2f337d2b0b20afb4bd6a5353d2f1c25dbba8dc19553e0c29943906a022b4d1e","observation_id":"baafe26f-2357-4050-b7fb-99c5e9acca6e","resolution":{"observed_at":"2026-08-01T03:02:03.269966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-08-01T02:13:11.772187Z","title":"Demystifying video reasoning.arXiv preprint arXiv:2603.16870, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-08T23:11:18.983142Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.772187Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:36f892a6ecf2c7fa3d6c63de8d75445b199960579f10d4cface5db7662322ab2","observation_id":"a1e35699-3f7b-4289-b025-7f4af4bed506","resolution":{"observed_at":"2026-08-01T02:13:11.772187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.16870/citation-record","integrity":"/paper/2603.16870/integrity","json":"/paper/2603.16870/citation-record.json","paper":"/paper/2603.16870"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:52.921494Z","title":"Advances in neural information processing systems 35, 23716–23736 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:52.921494Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:df0f43dd54ee1d74959fbf61b269d886d718969f3e9947df0c3fba9f357908c4","observation_id":"0f37a201-64e9-40b5-8115-2a32baea8c3d","resolution":{"observed_at":"2026-08-03T02:33:52.921494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T02:33:52.964918Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:52.964918Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:23069572f89dc381a1efd94192b9a4124810a1ad1e11ceedbcd1b12c0a6a164d","observation_id":"eaff6a74-4695-4296-8363-0a1950ad5250","resolution":{"observed_at":"2026-08-03T02:33:52.964918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:53.095672Z","title":"Neuron 100(2), 490–509 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.095672Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:007963d4f56b60c741e472d50ae8972c8b94145f1098036d89648ecd011e778a","observation_id":"f4820378-d8fd-49c6-b65c-495db2a7bb93","resolution":{"observed_at":"2026-08-03T02:33:53.095672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-03T02:33:53.187763Z","title":"arXiv preprint arXiv:2505.09568 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.187763Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:9b086e4198cb1edfa0ecc90354f7d09440953017d4b6590081bcf905ddc6d3a5","observation_id":"097e7648-d32c-4efd-8214-3d0523b5fa13","resolution":{"observed_at":"2026-08-03T02:33:53.187763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:53.311838Z","title":"arXiv preprint arXiv:2602.12279 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.311838Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:1fcaaa7d567b4f804aed51b49322ba0df877855e61a2da925ccb997deb67b53a","observation_id":"9dd078b8-1151-42d5-85c8-cc2c9a113731","resolution":{"observed_at":"2026-08-03T02:33:53.311838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:53.448633Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.448633Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:59c2d6699b3d8f40e8189cdf79973117d12d8fcab1b62c200ba6f449330201e4","observation_id":"39eb3e3e-cf45-4af9-b7e1-0628fe0c2829","resolution":{"observed_at":"2026-08-03T02:33:53.448633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-10T08:37:31.534307Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22525","snapshot_observed_at":"2026-08-03T02:33:53.570433Z","title":"arXiv preprint arXiv:2505.22525 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.570433Z"},"links":{"cited_paper":"/paper/2505.22525","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:0fd57846011f8fd88f93ee8dc71412663601d9081ad89feb82877253aef2ae4b","observation_id":"b2339c8b-b782-4231-8d29-031878628030","resolution":{"observed_at":"2026-08-03T02:33:53.570433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T02:33:53.617312Z","title":"arXiv preprint arXiv:2505.14683 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.617312Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:097f3f10dad6b67049235729cad63bd6722050395d983592e6285857253f461e","observation_id":"fd3ad8d6-45e0-42fb-8ad1-61a466a4cdcd","resolution":{"observed_at":"2026-08-03T02:33:53.617312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:53.674465Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.674465Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:b9b6e206d503f07ca586a63dd1f0f9c9a42e7c7a4965012051fe04205baf0d83","observation_id":"f70ffa70-5579-41ee-a828-8fb71f5b77ba","resolution":{"observed_at":"2026-08-03T02:33:53.674465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17022","last_updated":"2026-04-12T04:05:04Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:58Z","title":"GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17022","snapshot_observed_at":"2026-08-03T02:33:53.733424Z","title":"arXiv preprint arXiv:2505.17022 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.733424Z"},"links":{"cited_paper":"/paper/2505.17022","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:885f7e6140afafeacc9973f457db5ed043f6b4bfac298f95e58828e22633fce4","observation_id":"516faf33-70ee-4909-9683-b156ffc9db19","resolution":{"observed_at":"2026-08-03T02:33:53.733424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-08-10T20:23:52.962610Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-08-03T02:33:53.809611Z","title":"arXiv preprint arXiv:2501.08453 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.809611Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:ef8c348ec96836b105b37f60cf0b5dac164f4e267624f28693dedca755ae3402","observation_id":"11b88191-a3d4-4dfa-985f-636b32b79294","resolution":{"observed_at":"2026-08-03T02:33:53.809611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:53.870811Z","title":"arXiv preprint arXiv:2510.27684 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.870811Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:264616609a7e16490eb0bf2a458b791a36f4c0cf1e0febe366050cea4e203b40","observation_id":"ffd9ecd0-296e-4f19-8bc1-37937673d194","resolution":{"observed_at":"2026-08-03T02:33:53.870811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-03T02:33:53.930732Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.930732Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:7e8ab0382cf1e54c02cbe87ece62ed3d409e831bb9818fc54aeebb105159b1b3","observation_id":"3766ccda-d2e8-4b89-a5ea-a612eab982a5","resolution":{"observed_at":"2026-08-03T02:33:53.930732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-03T02:33:53.970685Z","title":"arXiv preprint arXiv:2404.14396 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.970685Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:d09916dc99e5432137a965427758afeee312ca1eff88de19651ed94a6d528fdf","observation_id":"c9ae9374-51f2-4a29-943f-6e9afd7eb16a","resolution":{"observed_at":"2026-08-03T02:33:53.970685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:54.074142Z","title":"Technical Report Veo 3.1, Google DeepMind (January 2026), https: //blog.google/innovation-and-ai/technology/ai/veo-3-1-ingredients-to-video/ , released January 13, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.074142Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:f79e606c0bb25bc01cb8ca351762739d9f05d0135abcd484323b5383d55cb16d","observation_id":"ad251a02-08dc-4a6a-8bc9-d18bc9b24c14","resolution":{"observed_at":"2026-08-03T02:33:54.074142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-10T15:25:57.194019Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-03T02:33:54.197765Z","title":"arXiv preprint arXiv:2501.13926 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.197765Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:f25bff56af91021fd403217e42dd378c1e775fd9af1c0dc567c22f1c44c51d85","observation_id":"17c05c7b-cb86-4bb6-a657-19a2bcbeb692","resolution":{"observed_at":"2026-08-03T02:33:54.197765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-08-03T02:33:54.270513Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.270513Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:fd3a110edbbfbdcfcc1a3d62292a63b026c410ec62beebab94d281644bac0538","observation_id":"2b14d321-d112-415f-a26f-9371d35a4e4a","resolution":{"observed_at":"2026-08-03T02:33:54.270513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-03T02:33:54.345493Z","title":"arXiv preprint arXiv:2412.06769 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.345493Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:a2ac8fc42e5a9d9e11a6c58d47babbbc53f4b9256b934da6efa54af6f5b7fa0d","observation_id":"e7546311-49ee-460a-88b2-9e59e75daff6","resolution":{"observed_at":"2026-08-03T02:33:54.345493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:54.416375Z","title":"arXiv preprint arXiv:2512.02622 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.416375Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:f7223f08f8ab4d61146099eda49437628206c2b6cf813c30aaa67cba3220de73","observation_id":"01f0d2eb-bc92-44c4-b0f5-3acaccabad6b","resolution":{"observed_at":"2026-08-03T02:33:54.416375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:54.489463Z","title":"In: Larochelle, H., Ranzato, M., Hadsell, R., Balcan, M., Lin, H","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.489463Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e6d34bfafd00b4e6fb94fba21fa116821228f90481454056207ba5250b7bf628","observation_id":"5763056b-9a86-49f8-b9b8-c70d511e0706","resolution":{"observed_at":"2026-08-03T02:33:54.489463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:54.573616Z","title":"In: Proceedings of the 2023 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.573616Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:bd31cd158d2502e2f8991a14e77afac173bc27447a2e7e37d450d4798a13f01b","observation_id":"dae0de17-10b7-422b-885e-d6148340e0fc","resolution":{"observed_at":"2026-08-03T02:33:54.573616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:54.644722Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.644722Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e7fbf5404f5e178d8e6c5b1afc2a9fb2c20d8adfcb4930038b92a8cd09aee832","observation_id":"e7ce3380-e8bc-4589-92ef-baf681f3e1f3","resolution":{"observed_at":"2026-08-03T02:33:54.644722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05094","last_updated":"2026-05-21T08:23:12Z","snapshot_observed_at":"2026-08-01T23:38:17.815297Z","submitted_at":"2025-10-06T17:57:59Z","title":"VChain: Chain-of-Visual-Thought for Reasoning in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05094","snapshot_observed_at":"2026-08-03T02:33:54.768104Z","title":"arXiv preprint arXiv:2510.05094 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.768104Z"},"links":{"cited_paper":"/paper/2510.05094","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e27a42439ec5443157462d6adc049e11375365e643e8c0b4a58d020963e57131","observation_id":"9036b58d-d12f-4cf9-ae27-f4630177d170","resolution":{"observed_at":"2026-08-03T02:33:54.768104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:54.904741Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:54.904741Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:0257dfc666dcbad46c674dd7c2f37a42d49451afcec0181f67949d6d073f0ccd","observation_id":"37feeb0c-ab25-4076-be2b-32d2b6ff2ec8","resolution":{"observed_at":"2026-08-03T02:33:54.904741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-03T02:33:55.036331Z","title":"arXiv preprint arXiv:2505.00703 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.036331Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:02dcf34f7e078c34c24138da2b125421698d8b490800d274544db4637f9f31c0","observation_id":"0e924498-084f-4499-a413-563005529d2f","resolution":{"observed_at":"2026-08-03T02:33:55.036331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-03T02:33:55.156467Z","title":"arXiv preprint arXiv:1312.6114 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.156467Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:3b6f3dd318bcc930f0303856805aade9aa23921b667daa07e4d235b495c1ca0b","observation_id":"a35fe085-c00a-4c49-a1ad-29dee50fef5a","resolution":{"observed_at":"2026-08-03T02:33:55.156467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:55.236134Z","title":"NeurIPS (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.236134Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:093dba36767ffe5e870a387282b716e8bccbfd535068e5731854b9bc3c866ead","observation_id":"af5925bf-b8b4-4ed8-a628-f116730c4493","resolution":{"observed_at":"2026-08-03T02:33:55.236134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T02:33:55.289369Z","title":"arXiv preprint arXiv:2412.03603 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.289369Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:380bae79971c7c4327d66d239ae08fd6777b8bd899432b1d6580adecd29ac8ab","observation_id":"1b4af0e4-6043-42d9-99c4-a6f6edff39b5","resolution":{"observed_at":"2026-08-03T02:33:55.289369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:55.356358Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.356358Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:1e0647a9d1589ba79ecf354fe7f670d1168c5ac13b7fbd09c213416dd9c10710","observation_id":"d0278788-d2a9-490f-8f71-bfbe3a30a828","resolution":{"observed_at":"2026-08-03T02:33:55.356358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:55.397252Z","title":"simultaneous audio-visual generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.397252Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e641825786791e46c0a4bed6aff9938e0e59dd0b1bd1cd99a9316e959f9eb072","observation_id":"70886151-777a-419f-a5b6-14b5dd8acc6e","resolution":{"observed_at":"2026-08-03T02:33:55.397252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-03T02:33:55.476154Z","title":"arXiv preprint arXiv:2501.07542 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.476154Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:6c5182989dc35e4261794c984ca0fbc7960ee92854adee737ca6254eb00be770","observation_id":"e17a3ed1-3199-4e5e-92d3-77967eb97d3b","resolution":{"observed_at":"2026-08-03T02:33:55.476154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:55.605877Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.605877Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:54e4c022d12fb822bf1126aa077d86c46f154b38a969fadb0bce553dda8c8ecb","observation_id":"96511202-ec72-4d57-9479-e51dd39acf60","resolution":{"observed_at":"2026-08-03T02:33:55.605877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17202","last_updated":"2025-06-20T17:52:31Z","snapshot_observed_at":"2026-08-06T23:28:33.159814Z","submitted_at":"2025-06-20T17:52:31Z","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17202","snapshot_observed_at":"2026-08-03T02:33:55.705653Z","title":"arXiv preprint arXiv:2506.17202 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.705653Z"},"links":{"cited_paper":"/paper/2506.17202","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:8f3a35ce737089a1fa9d88a775712613c8056537db0f72601aa32f19294cedb5","observation_id":"21d33951-39b9-4f9b-a8c4-8db51d955fc8","resolution":{"observed_at":"2026-08-03T02:33:55.705653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-08-03T02:33:55.844314Z","title":"arXiv preprint arXiv:2505.05472 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.844314Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:3b35d9f2ccfc9b642def364fa353bba668eb62bf3fece4451a23ac1f1f31445d","observation_id":"e78c0c14-6d6a-4dd8-9330-ccad39e82f4f","resolution":{"observed_at":"2026-08-03T02:33:55.844314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:55.981219Z","title":"arXiv preprint arXiv:2512.11464 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.981219Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:ae0c2acc4d3a665f298a0f4154e54bbbbc4b7cf420f419fe67ff6e600c9eb3d9","observation_id":"bb69a5f8-d580-49f2-ac6d-90bc26e5857e","resolution":{"observed_at":"2026-08-03T02:33:55.981219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:56.134175Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.134175Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:67d2a44359b8d83abb326fb3b778a0f48f8437620d9be860256d94cca67474a8","observation_id":"5584e8f9-1c0f-4618-9749-6390c1de95e7","resolution":{"observed_at":"2026-08-03T02:33:56.134175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:56.279752Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.279752Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:2551331dd4d871f88f3af6dd41f1db83450aaaa1ef6301e72e5f4bec73d960b4","observation_id":"264f299b-d416-4343-aaba-85d72ae9d937","resolution":{"observed_at":"2026-08-03T02:33:56.279752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:56.359412Z","title":"arXiv preprint arXiv:2511.16668 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.359412Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:0c6118cb1e0a706119343dc70e4c201af5824c9e5c8fe60b0ca98e3ac4c7e598","observation_id":"e63bac1c-283b-44a5-b421-70e161b0795b","resolution":{"observed_at":"2026-08-03T02:33:56.359412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:56.495190Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.495190Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:7b01801994feacfa9831dc2197775c01bf31d8c326494f0ec4b0dd6171b20ab0","observation_id":"89997916-1492-496e-ae4e-ab84913000cd","resolution":{"observed_at":"2026-08-03T02:33:56.495190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:56.656117Z","title":"Neuron 110(6), 914–934 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.656117Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:456d1c89afb083bd01e0b83fca311ec6d26aea469f079098abafb0d4c0e6feac","observation_id":"1163cc56-2a48-4352-904f-9974574aa65f","resolution":{"observed_at":"2026-08-03T02:33:56.656117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:56.760929Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.760929Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:db19feb140c46a0db4e36a5aca19d4ddcde0605c847311c3bdf9ed5baf1e338b","observation_id":"f6c8bd32-0cdd-45c3-84d6-221d60f0de36","resolution":{"observed_at":"2026-08-03T02:33:56.760929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-03T02:33:56.874814Z","title":"arXiv preprint arXiv:2504.06256 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.874814Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:10b9ee9389495037cdbc22f26f1daf7af68c92a80d368b0aae4cc29312b5c1ce","observation_id":"2947cdd5-766c-4992-b2cb-55f7e3e03625","resolution":{"observed_at":"2026-08-03T02:33:56.874814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:56.976042Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:56.976042Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e3035a2277b2d59d4f9b16dbfb7b1bc14877354171b8a1a32dfb7b9bfbe89453","observation_id":"5b3b89fb-608a-4898-9555-3de5ba8fe668","resolution":{"observed_at":"2026-08-03T02:33:56.976042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:57.091383Z","title":"Nature 497(7447), 74–79 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.091383Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:37d3f3fda98b65a7b2f71fc3317860b6422426a0bbd2a2864c77c751bcf3cbec","observation_id":"df04f4f8-7114-49d9-b9a6-f30f0b6197b6","resolution":{"observed_at":"2026-08-03T02:33:57.091383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:57.214974Z","title":"arXiv preprint arXiv:2508.05606 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.214974Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:17278404ac98bc95233b7c387e5d3708f8ad19dc20aa21b282401cca35a35a9b","observation_id":"12acc4b0-9372-4e7f-8a69-0d04b3b6be29","resolution":{"observed_at":"2026-08-03T02:33:57.214974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:57.366863Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.366863Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:7f7223057171b068cca1c467ac5154f20d2b356c1889b5d62bfd9fe3be303558","observation_id":"37ff14c8-08d2-4a33-988a-48a3b7e55eba","resolution":{"observed_at":"2026-08-03T02:33:57.366863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:57.492008Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.492008Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:f5d99111d72085ff52d606b16a4a7fd0dafb7d98f0bacf013aac0d834bbf0fb7","observation_id":"3fb10181-f827-4d19-a156-0722e0220711","resolution":{"observed_at":"2026-08-03T02:33:57.492008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:57.616115Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.616115Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:696d8b4d2babfa8dc4937f7e39b1b101918090218fb29b5cc19ad5119a17a7cf","observation_id":"8c5a1038-46f4-4a9f-9d37-48d223a30356","resolution":{"observed_at":"2026-08-03T02:33:57.616115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:57.733051Z","title":"arXiv preprint arXiv:2509.24791 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.733051Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:fc5da2d9e7e0cf226a98ca1133055e38a29db525791eb1520ab34bae3b22b10f","observation_id":"83fc4cf3-1d08-439c-acfc-809263045dce","resolution":{"observed_at":"2026-08-03T02:33:57.733051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-10T18:05:33.743501Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T02:33:57.876583Z","title":"arXiv preprint arXiv:2412.15188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.876583Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:4dd7c0475bfa3b83d11ccd853dfcf241c7a739cdc3b2f5145a4b6f2ec6289698","observation_id":"8f54f030-7751-43f7-9d1a-645e1db41827","resolution":{"observed_at":"2026-08-03T02:33:57.876583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:57.975767Z","title":"arXiv preprint arXiv:2510.14958 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.975767Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:dba5ff900a9e088bafe06f90a44008bf919e41876321e32632d3ff940b3dbd9b","observation_id":"42abb59e-6135-4e0b-97bd-1be2c051949d","resolution":{"observed_at":"2026-08-03T02:33:57.975767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:58.119826Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.119826Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:801254e2013af7e340540424ded6f115a73ec6373970d5b829837fee4c01a9f6","observation_id":"d11b36a1-2c3f-4a61-af49-4c4ce76fc6da","resolution":{"observed_at":"2026-08-03T02:33:58.119826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:58.225199Z","title":"arXiv preprint arXiv:2507.06119 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.225199Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e786ac831911320a1715a48fcdf0ef6d5f4d926e3506f6264e312b948c9ebb5a","observation_id":"a1a96eba-cd25-4557-b2ee-d3583052f493","resolution":{"observed_at":"2026-08-03T02:33:58.225199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-03T02:33:58.341491Z","title":"arXiv preprint arXiv:2405.09818 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.341491Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:f7899c339deebb5783ed67d6335724a912cfa9e5a41bb3c2f7dcdd2d7099d231","observation_id":"670869ea-7046-448a-a5a5-ed58481567aa","resolution":{"observed_at":"2026-08-03T02:33:58.341491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-08-03T02:33:58.465302Z","title":"arXiv preprint arXiv:2511.04570 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.465302Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:4d243d9aa1e1727998bba669e65a87f0e125d636fd08d4fe9a3162e7098df413","observation_id":"f471e0dc-1dea-4e03-9dc0-e2fe01729b3d","resolution":{"observed_at":"2026-08-03T02:33:58.465302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:58.622416Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.622416Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:cbc40eb31cb57a2993eb14b9eedbf571e07092bf0c4c60c09452c019fcfe3dd0","observation_id":"25c15500-b632-4d7c-ac3a-9bdf58c806f8","resolution":{"observed_at":"2026-08-03T02:33:58.622416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T02:33:58.782463Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.782463Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:f094a554453c7132c35fc909dc3240285063091b4813066e266a69647bb4d7db","observation_id":"d9051897-54b9-4e15-a5ba-b5f46a8e0f90","resolution":{"observed_at":"2026-08-03T02:33:58.782463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:58.952437Z","title":"arXiv preprint arXiv:2602.20159 (2026), https://arxiv.org/abs/2602.20159","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.952437Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:f1fcec9ee64a3a356e2beea7caa2d2a3fce618ceb64c2d7199a63b599a8f95cb","observation_id":"11eb632c-a796-451b-8407-2cc90c0e87b7","resolution":{"observed_at":"2026-08-03T02:33:58.952437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:59.115726Z","title":"International Journal of Computer Vision 133(5), 3059–3078 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.115726Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:dda6b258317a7d678562265d46c34d5d3d3fc476971918a96d4485f38c0e5020","observation_id":"af1c5d49-5e6d-4a16-9327-8967dda424b5","resolution":{"observed_at":"2026-08-03T02:33:59.115726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-03T02:33:59.253418Z","title":"arXiv preprint arXiv:2206.07682 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.253418Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:4a8b5d2478a8f87139c633ea49f64a3cbf595a04041b69e3d080c1dc8b7eb4ac","observation_id":"1102ae90-26a7-48bd-b9d1-0cf1f919283e","resolution":{"observed_at":"2026-08-03T02:33:59.253418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:59.385565Z","title":"Advances in neural information processing systems 35, 24824–24837 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.385565Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:2e9904584cb061cf7de46b81bbd3ddfe094a0f632afa788722207a5de7339dd7","observation_id":"4d1ab11c-f965-4e39-8430-6c37eb09ee6e","resolution":{"observed_at":"2026-08-03T02:33:59.385565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T02:33:59.549335Z","title":"arXiv preprint arXiv:2509.20328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.549335Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:84b9078fd41d9618dd37ba8100bac78c350caab2a0a8d865964db2b20aee9fe8","observation_id":"235c9488-a005-442c-aae0-b67a4bbaab26","resolution":{"observed_at":"2026-08-03T02:33:59.549335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:59.709374Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.709374Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:c4875ad225e9e83b99a96a28c0e4b992133bf4fe78112976026ca2cfc188f96d","observation_id":"45021f51-674c-4b4d-8f3d-d5b1ba22c13d","resolution":{"observed_at":"2026-08-03T02:33:59.709374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-03T02:33:59.819309Z","title":"arXiv preprint arXiv:2410.13848 (2024) 14","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.819309Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:493eaa9c930a6023d50846410cc86f96e337926e91f36e17d731255c9132bda0","observation_id":"187208af-d9ec-47d9-9672-b487604587ea","resolution":{"observed_at":"2026-08-03T02:33:59.819309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T02:33:59.925218Z","title":"arXiv preprint arXiv:2506.18871 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.925218Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:519e4ac7944be6546857c67ecd696f01d6b229dff05cc8f297fff654148d5098","observation_id":"9df42cb4-f0c1-4cdf-9ea2-3e0d77a4cf38","resolution":{"observed_at":"2026-08-03T02:33:59.925218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:33:59.981987Z","title":"arXiv preprint arXiv:2510.04290 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.981987Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:772fdcdf0847b8f99b890e75a8dff056336b91ac3b650a714869470d4467bee9","observation_id":"12d425a0-b7e2-4e3f-8cf5-3146297b1b50","resolution":{"observed_at":"2026-08-03T02:33:59.981987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-08T10:01:09.646573Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-03T02:34:00.137676Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.137676Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:6a2903578ac45a87b552c5cdd5dc56110ebd54e24d9c36f39c058d053cc658b8","observation_id":"a0967b82-5fb2-430d-ae00-a9f2fe1aabca","resolution":{"observed_at":"2026-08-03T02:34:00.137676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:34:00.247038Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.247038Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:15a9d6f0a598924102495d2b3ce59f720a83c30494eaf9b5164515ba2da5224c","observation_id":"bf877170-9014-46ea-b23a-59efc1ded141","resolution":{"observed_at":"2026-08-03T02:34:00.247038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02956","last_updated":"2025-04-03T18:22:20Z","snapshot_observed_at":"2026-08-09T23:33:43.014307Z","submitted_at":"2025-04-03T18:22:20Z","title":"Understanding Aha Moments: from External Observations to Internal Mechanisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02956","snapshot_observed_at":"2026-08-03T02:34:00.332846Z","title":"arXiv preprint arXiv:2504.02956 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.332846Z"},"links":{"cited_paper":"/paper/2504.02956","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:5c51b4ed2f734dbf67fcd2a3cb6db32cb48fa43dca327bdf232882280e14aee4","observation_id":"7cbc9ef9-354b-4349-8e04-04e7a71963fc","resolution":{"observed_at":"2026-08-03T02:34:00.332846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-03T02:34:00.443293Z","title":"arXiv preprint arXiv:2408.06072 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.443293Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:5671c9c4db2791f3c2f1e3b8609add1076a7ddad6762eab294ff852c65a08f6d","observation_id":"4a963288-41e8-4616-ab0d-fe9e3d9022d2","resolution":{"observed_at":"2026-08-03T02:34:00.443293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:34:00.579291Z","title":"In: Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M., Levine, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.579291Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:c530b54a45d37db865c8606c81bb7d2de866869de04e01bdb39f0040bbefc588","observation_id":"cf894df8-e668-4f5a-9d44-adf6bd97ecc9","resolution":{"observed_at":"2026-08-03T02:34:00.579291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:34:00.709082Z","title":"In: International Conference on Learning Representations (ICLR) (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.709082Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:a9c6f92d03bebffd04282e81bec86d83b65db1020773eeefa27d177ff7108b97","observation_id":"18660236-bce0-4e81-8c7b-69634b7a9b28","resolution":{"observed_at":"2026-08-03T02:34:00.709082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:34:00.817156Z","title":"arXiv preprint arXiv:2511.08585 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.817156Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:00549f452cf5bc537834f8821754e1179ee63d137dc335be582464c7fe886744","observation_id":"5e93bda6-b364-42ba-8712-53a4c8278e1f","resolution":{"observed_at":"2026-08-03T02:34:00.817156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-03T02:34:00.921622Z","title":"arXiv preprint arXiv:2407.08693 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.921622Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:a695953fe74f331d70504c9ce8d175db2bb421a702e26232f47e3c1c5cbd9db3","observation_id":"1fd5c3ea-c979-4587-a900-29ed70942d0a","resolution":{"observed_at":"2026-08-03T02:34:00.921622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-02T20:06:32.255780Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17685","snapshot_observed_at":"2026-08-03T02:34:01.085561Z","title":"arXiv preprint arXiv:2505.17685 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.085561Z"},"links":{"cited_paper":"/paper/2505.17685","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:c8c8bdba7897720a7d8fad5175e3183d0bf78f98d39a98ab700045c207fd7599","observation_id":"10b44e85-d8ec-4886-aa4e-cb42eca79b8c","resolution":{"observed_at":"2026-08-03T02:34:01.085561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:34:01.178591Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.178591Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:076d8cd444b4bf72e3f702313458fbaf41e307e4e4b39761c5849df6cd6c9adc","observation_id":"33b67750-7ebb-4e76-9b76-f56f83e82902","resolution":{"observed_at":"2026-08-03T02:34:01.178591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:34:01.245035Z","title":"Advances in Neural Information Processing Systems 37, 12847–12871 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.245035Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:252c9e7bbd25cdb82df07e945d1be96a6bb5885e0effe33e00dae38c485f35ea","observation_id":"a3d61ab9-1ca5-40dd-8f67-f100d397e96e","resolution":{"observed_at":"2026-08-03T02:34:01.245035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-10T02:47:20.223653Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-03T02:34:01.381315Z","title":"arXiv preprint arXiv:2503.21755 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.381315Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:08210934eec9b70e7debe40f0de160df36012f4cd77a050aaf8abd91be3575a1","observation_id":"0871f3ab-e617-4dea-8835-4fdf9977c74b","resolution":{"observed_at":"2026-08-03T02:34:01.381315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:34:01.488539Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.488539Z"},"links":{"citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:33fd6c7039667ca70fb2a3e0b29ff509cebf66712ef53863b07991d04d478ac8","observation_id":"62405ab9-1e9b-4b96-8ca9-86eeba6799b6","resolution":{"observed_at":"2026-08-03T02:34:01.488539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-10T17:14:06.898264Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-03T02:34:01.603385Z","title":"arXiv preprint arXiv:2501.12327 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.603385Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:760f8c6877d30a9f14cd2148f8a82edc111f77453a8c4862bc76eeb7078d910a","observation_id":"e988bc26-b644-4d96-aa89-0e5d9a344453","resolution":{"observed_at":"2026-08-03T02:34:01.603385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13759","last_updated":"2026-04-18T06:01:26Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T17:10:35Z","title":"Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13759","snapshot_observed_at":"2026-08-03T02:34:01.740152Z","title":"scratchpad","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.740152Z"},"links":{"cited_paper":"/paper/2510.13759","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:955e12952ad751702052a09069924f6c9de3463252a05211b2dc88f1b25fa4fd","observation_id":"db262d51-c76b-4fd2-b7c1-d22937148fd1","resolution":{"observed_at":"2026-08-03T02:34:01.740152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 7 inbound Pith citation observations for arXiv:2603.16870."}