{"as_of":"2026-08-06T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30cb44d096b67825b763e6d4fb8ac5c98de094401191fe92524c70b0e2f2b5b6","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:54:24.641649Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:23:36.183222Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:46:40.976623Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T21:00:58.473043Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2512.16776"},"observation_digest":"sha256:44a09f9b0121c005538ffbda90e1d2c6acd4e35f9bab5aaa838f9d593dc35365","observation_id":"bd2e331e-ca62-4140-ac2b-16b475336611","resolution":{"observed_at":"2026-05-15T21:00:58.574782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-08-03T05:23:36.183222Z","title":"Thinking with video: Video generation as a promis- ing multimodal reasoning paradigm.arXiv preprint arXiv:2511.04570, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-03T05:23:28.259581Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:36.183222Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:9e8be079e3363ec14a950f9438f40d7dc97c9bb08aa40493c5019feb94696a86","observation_id":"25739d30-0711-4cc9-840c-bd19894f9ed8","resolution":{"observed_at":"2026-08-03T05:23:36.183222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-14T22:25:04.080629Z","title":"Thinking with video: Video generation as a promising multimodal reasoning paradigm.arXiv preprint arXiv:2511.04570, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12252","last_updated":"2026-06-18T07:56:55Z","snapshot_observed_at":"2026-07-14T22:25:02.474086Z","submitted_at":"2026-03-12T17:58:48Z","title":"EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T22:25:04.080629Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2603.12252"},"observation_digest":"sha256:f5b4822afbf6ca7d7304ef0106ff9dce7508e2124a62387c379a9200c01727e4","observation_id":"eda22b86-aea4-40d9-b931-ce5b33cb746b","resolution":{"observed_at":"2026-07-14T22:25:04.080629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2511.04570 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:0d1cd4960f354ce21761c0689aecd2b15fd591a6ed60ebee47e0dfd803af444a","observation_id":"7e65bc2e-827e-4b94-bee0-2a48c58c49b4","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-08-03T02:33:58.465302Z","title":"arXiv preprint arXiv:2511.04570 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:58.465302Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:4d243d9aa1e1727998bba669e65a87f0e125d636fd08d4fe9a3162e7098df413","observation_id":"f471e0dc-1dea-4e03-9dc0-e2fe01729b3d","resolution":{"observed_at":"2026-08-03T02:33:58.465302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-02T21:32:46.195325Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:cb983560c90fc92dad5aba536dc4ff8ac89db96d22467f9ebe5cf0acf8cd6c03","observation_id":"06207086-defd-46b3-971c-ed06e3d5b810","resolution":{"observed_at":"2026-05-11T13:46:03.125700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2605.15458","last_updated":"2026-05-14T22:40:56Z","snapshot_observed_at":"2026-08-01T23:49:14.751351Z","submitted_at":"2026-05-14T22:40:56Z","title":"Video Models Can Reason with Verifiable Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T15:03:14.894952Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2605.15458"},"observation_digest":"sha256:9b2a0dbdcfea9a756a44698c568bf2faf69650fbbed4af039f1b544e128a2c61","observation_id":"05861950-70fd-49ee-ac44-c85e1a1a0057","resolution":{"observed_at":"2026-05-19T15:07:37.190619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2605.26918","last_updated":"2026-05-26T12:16:41Z","snapshot_observed_at":"2026-08-01T21:44:13.728036Z","submitted_at":"2026-05-26T12:16:41Z","title":"Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T18:17:52.284353Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2605.26918"},"observation_digest":"sha256:16c2f8d15d982b2516601cac8dbae1f88d73d979f7e3e53f98bf55f03a984e1d","observation_id":"6e84f652-d9c5-4d06-90ed-905ab170667c","resolution":{"observed_at":"2026-06-29T18:23:50.880681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:2af0ba454cc61313935366e6d29a1f4b393747f2eea3b95786dd188d875c0832","observation_id":"ed1158d7-a5ac-48a2-bceb-0f6ba35a35ea","resolution":{"observed_at":"2026-07-01T22:26:17.349322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:f722cf9a9318e1e91019ecb0670c097dc9986b4cfe4e8581739bb652a2ed91db","observation_id":"e574146b-899b-42f2-95b0-b6c82a161f70","resolution":{"observed_at":"2026-06-30T10:44:36.835287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:ab5544fd09b7a4156cf053fec4a3df9f83046764b9db772693b88968826ffacd","observation_id":"8d548877-7965-45a0-9a44-69bf59a5576c","resolution":{"observed_at":"2026-07-01T10:05:40.236863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:bde8a35c8fd15dca053c85bb535d8a4d7e07acdcb4c73a0c704a6dd1031132ef","observation_id":"d93dd5b9-05b3-40a7-b701-81dc87bb4625","resolution":{"observed_at":"2026-07-10T01:46:40.977806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-08-01T21:07:27.491168Z","title":"Thinking with video: Video generation as a promising multimodal reasoning paradigm, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16401","last_updated":"2026-07-17T18:00:05Z","snapshot_observed_at":"2026-08-02T23:36:27.285941Z","submitted_at":"2026-07-17T18:00:05Z","title":"Apple-$\\pi$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:27.491168Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2607.16401"},"observation_digest":"sha256:1ee96dba11c84e5add18c19ab3aecf7e4683d9e0876ccc5361610d4c8ec2c495","observation_id":"caece559-b57d-4b2e-988e-553c55d87fae","resolution":{"observed_at":"2026-08-01T21:07:27.491168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.04570/citation-record","integrity":"/paper/2511.04570/integrity","json":"/paper/2511.04570/citation-record.json","paper":"/paper/2511.04570"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System card: Claude opus 4 & claude sonnet 4","venue":null,"work_id":"fafc0116-b3b0-4216-ae43-9bac2e506f92","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:e7f79efaf2173cabca964ef7b868f883071c00dbf70910e9831c11e42af46172","observation_id":"4a6210ad-2d6c-4050-91db-2043878113d4","resolution":{"observed_at":"2026-05-18T01:32:18.381268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:ed17f0b2929f637694ebcd9b39435e0ee45bb9b377b5fb8423b96bf37b6f841f","observation_id":"24783198-2c0f-4560-aa44-422cd7016f1b","resolution":{"observed_at":"2026-05-18T00:55:35.174854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":"2503.09567","doi":"10.48550/arxiv.2503.09567","metadata_source":"pith","pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-07-10T18:57:31.639044Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","venue":"cs.AI","work_id":"0b361fed-cf2a-4b90-b61a-de88de4b8840","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:6b20aaf4c4486361f91adb6216226eeca9f22eb72db0a50f3ede87424caa4d18","observation_id":"8d1e9b02-affb-4ddc-9554-3c31e578e769","resolution":{"observed_at":"2026-05-18T00:55:35.171420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13315","last_updated":"2024-08-17T11:56:08Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T05:37:24Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","version":3},"cited_work":{"arxiv_id":"2403.13315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.13315","snapshot_observed_at":"2026-07-02T23:57:28.214249Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","venue":null,"work_id":"926e9650-5c7c-424c-a1db-2f5573108252","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2403.13315","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:e43132a4bdcf45776c9854e25fbeb0795c2ab0802b742554da324b0721800ce8","observation_id":"01759ace-d87f-411a-ba98-e7310f835613","resolution":{"observed_at":"2026-05-18T00:55:35.167332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11831","last_updated":"2026-01-15T23:30:35Z","snapshot_observed_at":"2026-07-06T21:25:27.942187Z","submitted_at":"2025-05-17T04:34:48Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","version":2},"cited_work":{"arxiv_id":"2505.11831","doi":"10.1145/3474666","metadata_source":"pith","pith_arxiv_id":"2505.11831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","venue":"cs.AI","work_id":"2957f2ae-a92d-479e-a1ff-b0b522445d0b","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2505.11831","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:78e313ac752bc423db9bab07d317449c8d88ff9c99479cc51dc52ee68fb6f5f4","observation_id":"d50a2f0e-551c-4a75-9b42-45221f4d661d","resolution":{"observed_at":"2026-05-18T00:55:35.178851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:edae5f073acce2c45cc2b57d75cfc6e8632cdfb36245f1603e2fc2247ad5ef2e","observation_id":"797019a0-089f-45b2-b3e0-066747a726d6","resolution":{"observed_at":"2026-05-18T00:55:35.153536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:0867fa0bd5fc1b9da16853b4078e2b0f7ba9902cd90d9f0a67fa340817c5e9bd","observation_id":"1d2ae126-c49f-4a38-a5e6-079127cc34eb","resolution":{"observed_at":"2026-05-18T00:55:35.148843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:43bf800d6a45297360947ce8206df95323fb3e6c53908d950a0ea4f77489fd3f","observation_id":"f6d047db-2a61-435b-af07-280e9e5a2503","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:108dceb0436d547037c392f166fa8c0e2da10665ded6dbf7265e6751ad56888f","observation_id":"ae65fa33-1014-463c-adb2-793fa5cdd2e0","resolution":{"observed_at":"2026-05-18T00:55:35.144057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:04930d6ea1f9814621338db37f7182f1fb16b5795c01d92f949d566a55f82651","observation_id":"af316306-02c3-46c5-a372-a213b2a8501a","resolution":{"observed_at":"2026-05-18T00:55:35.127900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":"2301.00234","doi":"10.48550/arxiv.2301.00234","metadata_source":"pith","pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on In-context Learning","venue":"cs.CL","work_id":"864701ca-cb36-4a91-9be8-e2b9b20679aa","year":2022},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:5fcbfbb755c3219524d04419b624cd6f7f9af8db941dfb443f2ab17dac1466a4","observation_id":"b22ae060-4b90-4ef5-b9fd-aa062bf65f31","resolution":{"observed_at":"2026-05-18T00:55:35.139311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":"2502.14739","doi":"10.48550/arxiv.2502.14739","metadata_source":"pith","pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","venue":"cs.CL","work_id":"58a97b2d-494b-4c1a-bd65-13fa6bb7f8f6","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:6de588b449819f37a21e5e611b6ce625fcf19016f62744eb6e3fb763fcde9b12","observation_id":"03d3891d-1d02-4249-9528-092d4c542964","resolution":{"observed_at":"2026-05-18T00:55:35.122041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:42.853111+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:42.853111+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 3.https://aistudio.google.com/models/veo-3","venue":null,"work_id":"b7256443-7e73-44a2-ae8d-ac572dd5450e","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:9d3bbbb9c400418528295232a9a000383b580656bbdebc168ad8cb3ac2ed3dbe","observation_id":"c7de72b6-4ee3-48d4-aad6-5762bac31158","resolution":{"observed_at":"2026-05-18T01:05:35.468963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.5 flash & 2.5 flash image model card","venue":null,"work_id":"4e86512b-dac0-45db-bb5d-b086ab00f7ef","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:bc60af8a91c35ce2d17d6afb9d63f597880dc54fbd9ba15999b5e82c9a789dd0","observation_id":"e5474820-96a6-42dd-842a-4c82e00e5cfd","resolution":{"observed_at":"2026-05-18T01:05:35.446959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0518effe-3d2c-47ab-b5f8-857fc927ac0d","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:47f00b8b6573ff3bd36f4f74ee4bfbb4ff49201e901bac1f6f015708b2e1b379","observation_id":"ba2d6648-2481-4cb3-bac8-cc9625714b58","resolution":{"observed_at":"2026-05-18T01:05:35.493339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.26802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.958177Z","title":"Are video models ready as zero-shot reasoners? an empirical study with the mme-cof benchmark","venue":null,"work_id":"9b88873e-00b7-4c70-91a0-59d9c610d094","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:2735ef987f2e04861a381e4dc5dbc791c4caf46e698ba85fdedef9043049d7c4","observation_id":"f6cf9f60-b7b2-409c-8e87-cf770d961d8d","resolution":{"observed_at":"2026-05-18T00:55:35.134168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:16f06f9fa3ccebad3dc38d19e0e13ae9be8d1837dfb913c05c08f0df7e55aadd","observation_id":"67898fd8-ab45-406a-ab6d-8d6362d280fa","resolution":{"observed_at":"2026-05-18T00:55:35.105346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:e9ebcd75087eb0b64bd6e72f357f24689975707177e360ec544dd6a4e8f79935","observation_id":"b282db82-6de7-4f38-abd8-4a7a0b29f2a9","resolution":{"observed_at":"2026-05-18T00:55:35.109122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:31f773ba3e1cddde0d2bee278ba3a50e5778270eb152cec64373e1f4e1efe3f3","observation_id":"33abd66d-501a-4660-9dca-bb67f03953cf","resolution":{"observed_at":"2026-05-18T00:55:35.113178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13980","last_updated":"2024-09-21T02:10:19Z","snapshot_observed_at":"2026-07-06T19:19:06.790588Z","submitted_at":"2024-09-21T02:10:19Z","title":"Enhancing Advanced Visual Reasoning Ability of Large Language Models","version":1},"cited_work":{"arxiv_id":"2409.13980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.13980","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing advanced visual reasoning ability of large language models","venue":null,"work_id":"ea27daa6-b639-45e1-a788-137df7dae9ac","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2409.13980","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:731778818c21b472d0cf8fe98ae25f3b82c19f8ebe0a675efb755f9115f840b7","observation_id":"28bb8881-8720-433a-a626-32391014ba2d","resolution":{"observed_at":"2026-05-18T00:55:35.117377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computervision, pages 216–233","venue":null,"work_id":"5163f6ba-e63d-4f77-9e16-a6398adb4598","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:59ebb99b0720c837d924684f2e2513ff7dfcd9d250e2bf0747ac4b4f0f00e986","observation_id":"67697a59-fd70-4836-8005-c5cddc0cfa60","resolution":{"observed_at":"2026-05-18T01:32:18.378628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:3337edbc170ee4952919206265b62f3b86df16399843689684553f1558a16f80","observation_id":"2d594898-c52e-47af-b569-cfc6d31da99e","resolution":{"observed_at":"2026-05-18T00:55:35.182626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:3c0346c04f5788b2b3e295e3394a0e8f329b1cdfa7ebbba0e48ad98a375cfe54","observation_id":"374e3105-e63e-49be-ab2d-a804c600d60d","resolution":{"observed_at":"2026-05-18T00:55:35.158165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-5 system card","venue":null,"work_id":"31879730-ce57-44e5-8697-b9045b13a910","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:a3495e824d8f23777f9a2c4b23977f5873505dbf7b489a265d07b21ea4a0b1f1","observation_id":"7d929fe1-a5c8-4e47-a0a1-d331604adebf","resolution":{"observed_at":"2026-05-18T01:32:18.375199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with llms","venue":null,"work_id":"8b1a62d8-0829-4603-9944-9df685df6572","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:6dd3d42791dcf8a37d5eae3c355326a2b7b33fde6583a9e088aa2ecc0fdafb9a","observation_id":"32784cca-2eaf-4d46-8e4a-75cd43405d74","resolution":{"observed_at":"2026-05-18T01:32:18.397886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenAI o3 and o4-mini System Card","venue":null,"work_id":"88bb59c2-98f0-491a-be3d-a45c0221e7b0","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:72e5b4faf163425f242cde1e7d1ff67ca5ee29d792daf48e26acbeffa393df16","observation_id":"35b2e7e6-79d7-483c-b10a-d3f7cf646338","resolution":{"observed_at":"2026-05-18T01:05:35.520694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"2cbf91cf-23e7-4e07-8913-29a5ad156259","year":2018},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:c1cfdbaf4a8bbbf656c63ee6d58fa761ba2fbb4b706c4f493650c4ad1c0bed2f","observation_id":"6ea2b7f8-9b9e-4384-9659-5ac7b35aa2d2","resolution":{"observed_at":"2026-05-18T01:05:35.472735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"0a827b11-4832-43da-b35e-153ca1df691e","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:b8ca7b0623b2fad63624f55014c903afabc187f3509bbade46b499e8f458382e","observation_id":"f8d2e659-612c-439e-9c5b-0130df993cef","resolution":{"observed_at":"2026-05-18T01:05:35.461522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing Gen-3 Alpha: A New Frontier for Video Generation.https://runwayml.com/ research/introducing-gen-3-alpha, June 2024","venue":null,"work_id":"436a25b5-be2b-4e36-9b0b-e64f24acf4f6","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:d7510bbe476d42cfa406180de62273d05d3682555705f8e8a7247700ffaf256c","observation_id":"d002bcd8-fa71-4753-9ad8-a7ac67e46cd0","resolution":{"observed_at":"2026-05-18T01:05:35.503402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:eb9adee9a7c89c624fffa9b822a52b18d2beef648296ea895cd4d1f4d4a84934","observation_id":"667298d5-fa3d-498c-a207-4e89d4a69b8c","resolution":{"observed_at":"2026-05-18T00:55:35.097599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code2logic: Game-code-driven data synthesis for enhancing vlms general reasoning","venue":null,"work_id":"dcc8a5a9-d950-40df-bc2f-f14dd5b62186","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:109a3c50122969ffd5eedee27282efc57f7f843bf62c4b96c9027e1b8023aff5","observation_id":"2f351b37-97b5-4816-b2c7-3da16616038b","resolution":{"observed_at":"2026-05-18T00:55:35.102017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:e140643a42087977572394b3b6cbf86a1903473b3dad06eb541ca7f9d4d64d90","observation_id":"8a2e46f6-9f6c-42a0-ba6f-499a75b6b0a0","resolution":{"observed_at":"2026-05-18T00:55:35.092815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.Advancesin Neural Information ProcessingSystems, 37:95095–95169","venue":null,"work_id":"ef791b86-a5bc-4919-b74c-bd3da8d60b9d","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:439698f5fe7a0e93a9a7d5c50ed0dd4f4acf984639798b020f3bb6c7b6703ce3","observation_id":"bc26ea48-6c7a-4a7e-a2be-a2538bf22d65","resolution":{"observed_at":"2026-05-18T01:05:35.513972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:fc212ef5aebff6aa77faad444fe7ea8bd1f6b0942a3ab134eb2f7dbf28252507","observation_id":"ec7f6cd8-3745-49f9-bb91-c0d1176833f8","resolution":{"observed_at":"2026-05-18T00:55:35.081325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"1ee88ab0-7965-4435-826c-80fd950bf61d","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:3822ffb54cf46cc184e17c52e8dd28b2d6faf82f3b1bb43bbe18e40bf45fba24","observation_id":"26640546-4595-49d2-8227-8db44df323fb","resolution":{"observed_at":"2026-05-18T01:05:35.490061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thoughtpromptingelicitsreasoninginlargelanguagemodels","venue":null,"work_id":"a0811bc1-27c0-45f3-943d-f1ae4e84e493","year":2022},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:7acaf28f6dc0ad58e94703e851ee7f99de497a17903ed8443212fdb3c5447c10","observation_id":"4b80c960-58df-4b07-9aca-2dc8a0465b32","resolution":{"observed_at":"2026-05-18T01:05:35.517363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:3d1372dc647a68fec848cadf2c1d21b6fb9af74ba2a1e2c4f156c87aca2d192c","observation_id":"9980435e-eb6a-4904-aba3-28082a0df574","resolution":{"observed_at":"2026-05-18T00:55:35.077440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:b643b8c0aea5f87f2ec743a6dfecf1ecc9a414286691407ce710ad3193c3f519","observation_id":"9b2cffb6-d8f0-48ed-9deb-35bdb42c302b","resolution":{"observed_at":"2026-05-18T00:55:35.088958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":"2502.03373","doi":"10.48550/arxiv.2502.03373","metadata_source":"pith","pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","venue":"cs.CL","work_id":"6d35a498-cdd6-463a-a0d9-5a29224a06d8","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:bd7bcf235a22394d90d544da8341030696d2da1c3172450e3d98ae70562c44e4","observation_id":"33445499-1eab-4f7e-b8f4-84c94001d3ce","resolution":{"observed_at":"2026-05-19T01:29:59.463518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.713302Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"ed02e0a4-dc7a-4c66-8d03-56f379423da8","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:1dd24853f563ca4ed9d71a03f793986100b7d84934fffec23cf8779f79bfdd79","observation_id":"3b10c898-003a-447d-a413-8ccdbb4580b3","resolution":{"observed_at":"2026-05-18T01:05:35.454507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rewatch-r1: Boosting complex video reasoning in large vision-language models through agentic data synthesis","venue":null,"work_id":"8d195f42-4645-45a6-a213-51cf64ab8fb7","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:e6bab864bb384ad8e7aeb938096c7fe61c427d0d88d4894a730e67a013c94254","observation_id":"2818f3ee-7a98-4abb-84e0-01309a1319fc","resolution":{"observed_at":"2026-05-18T01:32:18.392093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23652","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.686625Z","title":"Rewatch-r1: Boosting complex video reasoning in large vision-language models through agentic data synthesis","venue":null,"work_id":"f5991ad6-e567-4533-97fb-74a2fa2ab9fe","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:f922cae76dff886a4b511d28663b11902118008a0600afc2fc84140fa7ecd491","observation_id":"ff49280c-142a-447b-8902-af0fa6d7ca9a","resolution":{"observed_at":"2026-05-18T00:55:35.073729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09876","last_updated":"2025-07-14T03:21:13Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T03:21:13Z","title":"ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.09876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09876","snapshot_observed_at":"2026-07-02T12:46:56.833017Z","title":"arXiv preprint arXiv:2507.09876 , year=","venue":null,"work_id":"d08ca88f-8f20-4d09-880f-0151d0e8d1ba","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2507.09876","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:f74977f5eea8f56dd9b324865117b6b83bde3f475cad8424ed9b710886db068f","observation_id":"558a108b-cffe-40fe-a71d-db26eebee2c9","resolution":{"observed_at":"2026-05-18T00:55:35.070077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:62716566a2f91cdbbaa1dd847b81744c54d5eaf7de382cf75733a2bcc89db15c","observation_id":"95dbf2cf-d48c-4ec7-bdbc-ebde4de5fcc8","resolution":{"observed_at":"2026-05-18T00:55:35.066474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06680","last_updated":"2024-10-10T14:38:37Z","snapshot_observed_at":"2026-07-06T18:12:47.499337Z","submitted_at":"2024-05-05T16:35:30Z","title":"Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":"2405.06680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.06680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the compositional deficiency of large language models in mathematical reasoning.arXivpreprint","venue":null,"work_id":"963b9781-1ab1-4074-8e55-cb6913bd0f0e","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2405.06680","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:231a175d80db069f0d0f814f45395a5ecf335d16aef3f0dd469ee1bbc5ff3537","observation_id":"3002ca2b-7775-4fcb-ba72-258f490afabe","resolution":{"observed_at":"2026-05-18T00:55:35.063035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"coverage difference","venue":null,"work_id":"8366570f-4ed8-4ab7-b9c3-4c74b1179440","year":2023},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:808d0f306c9f5d82c7ea324deea1552a8eed80c9534c5e9aaf0f6f4c64a937c0","observation_id":"8296ca9e-a8a8-42fe-a1db-930756ac1115","resolution":{"observed_at":"2026-05-18T01:05:35.464918Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The answer is","venue":null,"work_id":"dee03606-0bb4-4532-8e98-3e1d525207e3","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:3b46a40c642d3f2b8d1bda5006078065cda2656f409d7a652d063f891440dc88","observation_id":"5c117c6a-be6a-40fc-9b44-e2b5f517b2c2","resolution":{"observed_at":"2026-05-18T01:32:18.394798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0e3bd9cb-3865-429a-9c76-b0758c38d699","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:837731159485a7d7f136dfd34f244b126644ba879b1d7cbf68a475211da457d5","observation_id":"f5a2f150-603e-4cf9-8172-d63b039bdc1b","resolution":{"observed_at":"2026-05-18T01:32:18.402684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"28c36865-a805-4037-9907-dbac51c921f1","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:b650b75283bc115db502c4244d8d2c363a701481eef09aa0f0de1e08aaf740c5","observation_id":"b2518fb1-db59-4b4b-96f2-1f43497b120e","resolution":{"observed_at":"2026-05-18T01:32:18.400238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca382fdb-961b-4ab7-a297-6086708805dc","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:507bc7ecd07b8d99d6b4e078da5eec0685961384346f65ac7dd6c81abbdbd585","observation_id":"bf7726de-3f47-492d-8390-7ab393eb13f1","resolution":{"observed_at":"2026-05-18T01:05:35.476186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"4” vs “4.0","venue":null,"work_id":"3a2650fc-7d06-44b7-b89c-b9f7925b61ae","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:fecf3034e565e178f58d25abb1f38db8c18ff5273bb8a4c0ebcf6abc50da32da","observation_id":"78c6c0a6-8bcb-4dde-b20c-df2ab079af1d","resolution":{"observed_at":"2026-05-18T01:05:35.496576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2fd0c117-dd84-466d-b7ac-d976bb292877","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:36932d340f220c811ae17a49db4455a8a68c94243a966819c76245ace1e19f30","observation_id":"7bd62a01-49e3-4670-b73e-d8b531d5822a","resolution":{"observed_at":"2026-05-18T01:05:35.450763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your task is to determine if an audio transcript from a solution video contains the correct answer to a given question","venue":null,"work_id":"d70d6dea-8af7-4217-8dbc-867d61477ec3","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:9608bb95e92728dcedb8b22f012aedb5fdaf331216e0e3dbdf90b7e451f10b7a","observation_id":"1f3bfedc-c78a-4592-aa0e-e8e7171a56b1","resolution":{"observed_at":"2026-05-18T01:05:35.506874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ec42ed0-701f-4a44-8a6f-70a0666edaaa","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:f67a0fe495b152247cb1ece73f0160ceffd3da626a920739fc188799edaba1a9","observation_id":"a97d2ecb-46f9-48e3-aa32-968e18595bb3","resolution":{"observed_at":"2026-05-18T01:32:18.383694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"510bcb35-c36a-42b4-93a4-89437d2fc12a","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:51bb92f82f9b0817c1dcfb0bdbdf5c5b836de6e0587f07b1e97c0478e2d60288","observation_id":"e5025b50-3d1a-4bb7-9701-ae8e44c39ed3","resolution":{"observed_at":"2026-05-18T01:05:35.527297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a3e53b64-734d-4ba3-a5a8-ba8feffb8a02","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:74b9d8343999c0466d4f48145a423ee8a354cae89d2b9d4ad9edf446663dbc32","observation_id":"21884392-a320-449e-a8b3-dc1a9a5c9650","resolution":{"observed_at":"2026-05-18T01:05:35.486572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d421504c-e669-48bd-85dd-f09b46c272dc","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:d58c70babf8b68f52345fa20163e2d3b861c93e08abec7f1f459942ff2f3adf3","observation_id":"3c55ef35-7654-474b-884b-747217e1e351","resolution":{"observed_at":"2026-05-18T01:05:35.499973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"80a2abe2-73b0-4f7b-90c3-bae521677f8b","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:7b3ed4583b983c3db36971ae1a4c097d7b1bee96234222f08d6de3a167c576e3","observation_id":"59a965d3-dca6-4c83-a6d0-669c0da2bda4","resolution":{"observed_at":"2026-05-18T01:05:35.457927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the correct answer is","venue":null,"work_id":"88e2c68e-2913-40e3-876d-248963c6d935","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:7cfc307f088999b14a4e46fd46f3fcf361742e38023232f74f39903845300814","observation_id":"43197749-3c3d-437b-9b45-434bd6b8e7c5","resolution":{"observed_at":"2026-05-18T01:05:35.479760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A” to “E","venue":null,"work_id":"f2acf066-4949-4bda-a616-b39eaf88f2a3","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:ae21930c4ab9099aafc37cafd723eeb4f68434634188fe68324200783298fa13","observation_id":"1f83a8ec-a6f3-46f6-9b51-f12fc8f9b502","resolution":{"observed_at":"2026-05-18T01:05:35.523988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bf91debd-775e-4e5d-b251-ef455ac99998","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:298e608ade642910ea5346ded6d99422483fd60c91907323f07421718243a0bc","observation_id":"92b680eb-d926-4adb-9ed1-b7c3f2cfaa3f","resolution":{"observed_at":"2026-05-18T01:05:35.443280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"357b514b-b2c5-4b2f-9c18-9dd1669595aa","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:c4f5eeba5bebb89a46eb9bec4e878321cc6d02f967b99bb1926960e45cc10ccf","observation_id":"d99680c1-0226-4d58-8356-f9bd6b40a448","resolution":{"observed_at":"2026-05-18T01:05:35.510263Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33ceba92-d31b-4443-8c57-ba37b214439f","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:ced8a212c6f65ef897df2292593e7145135d909b8dac1f7db4dc478d34176efc","observation_id":"142902e0-7aa7-47b7-b232-ab122af26538","resolution":{"observed_at":"2026-05-18T01:32:18.389228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"72f095a4-18d0-45b3-80d5-3a422ef36764","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:e4d18270fa0f4508f5848bb8360c5b28b26da0bfb211ee8caaf43156473372b0","observation_id":"b2a13b9f-e45f-4c46-b994-454835469a8e","resolution":{"observed_at":"2026-05-18T01:32:18.386887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6113c387-743b-4842-9cd3-4df34848adb3","year":null},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:dfd8308725c3caa8fc31186c6d772b08cbc617c46838f3fd280a02f8aaf0df7c","observation_id":"c779ccf8-d6b1-4c1a-af8d-dc2172977c6f","resolution":{"observed_at":"2026-05-18T01:05:35.483051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":28,"verified_fuzzy":20},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 13 inbound Pith citation observations for arXiv:2511.04570."}