{"as_of":"2026-08-16T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d959ffe7822f4fd00d3d0a53dbff23be9db4cd2fbddf419b2bf44e06d2025803","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T01:43:37.265723Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08763/citation-record","integrity":"/paper/2607.08763/integrity","json":"/paper/2607.08763/citation-record.json","paper":"/paper/2607.08763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.708984Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":"f6abe88d-7f0c-49a9-aa0b-1f09e1926d6e","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:9d8ad604ad95104cfa7b3c13839f787e6e52a52388f5f1435db0dc8c9a24fc37","observation_id":"9023a7b8-c75c-4c9e-a37d-4b6b650524a3","resolution":{"observed_at":"2026-07-10T01:46:41.710227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.949924Z","title":"Mmgr: Multi-modal generative reasoning","venue":null,"work_id":"a0c3f635-dfea-4dbc-8c13-bf10cab2777c","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:89aa25450355c73e4fb90b8245eb8a63f438fabb67c459236a65b73811f2b855","observation_id":"b0ff4bdc-f080-49a9-bb31-5b9db8fb612d","resolution":{"observed_at":"2026-07-10T01:46:40.951462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.961230Z","title":"arXiv preprint arXiv:2511.13704 , year=","venue":null,"work_id":"43eb1254-d612-4d1c-8e0e-b7a05936c90d","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:5a5a5aed83ffccd862247da83fbb38489b4cc6cdfe53d7ec25459545c8b586fa","observation_id":"6891cb1f-3420-475d-9ca0-96b142251f54","resolution":{"observed_at":"2026-07-10T01:46:40.962721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-16T07:14:23.993847Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":"2506.05331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05331","snapshot_observed_at":"2026-07-10T01:46:40.974962Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of- Thought Reasoning","venue":"cs.CV","work_id":"ae2c8c54-232b-4ff7-8f07-d23ab761b067","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2506.05331","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:ad469fab6b2e31812225d793fa4d47facd386df9a3042657fbce8732eb3c9570","observation_id":"af841a16-d433-4220-9a54-c8c40f4ca6d0","resolution":{"observed_at":"2026-07-10T01:46:40.976230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09151","last_updated":"2023-04-18T17:45:50Z","snapshot_observed_at":"2026-08-15T20:10:38.132908Z","submitted_at":"2023-04-18T17:45:50Z","title":"UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining","version":1},"cited_work":{"arxiv_id":"2304.09151","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.09151","snapshot_observed_at":"2026-07-10T01:46:40.955868Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining","venue":"cs.CL","work_id":"9da4d481-3b5d-4112-a875-d7485df66a3b","year":2023},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2304.09151","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:e24408a6f764f02c80f9199ec6adb2908f6f282d2f958604c2f77665c2398b75","observation_id":"188fa137-da5c-4ef5-8765-2935a5d615e1","resolution":{"observed_at":"2026-07-10T01:46:40.957102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:53e0ffffb0a2c491228077854b9c35474ba0e89133f5fb5b1d27c427f035818c","observation_id":"b6fb3e8c-3d45-4037-9f75-6ff610ad38fd","resolution":{"observed_at":"2026-07-10T01:46:40.941636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-13T04:59:18.865958Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":"2312.11370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-07-10T01:46:40.938849Z","title":"G-LLaVA: Solving Geometric Problem with Multi- Modal Large Language Model","venue":"cs.CL","work_id":"3a63b857-2284-4d2e-93fe-e112cfbc77ea","year":2023},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:84fd1c295cb52dc991a4d9897b161adee451cf1898b84ce1924309720b620396","observation_id":"9c5d7403-a04f-43d1-b567-b3c9a1805600","resolution":{"observed_at":"2026-07-10T01:46:40.940154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-16T06:22:30.143972Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:7c2238d041a92ded275b69b7c214033ff49d6c6f88ccdb2374fcb846a0eb71b7","observation_id":"f0a263af-4767-4c36-b6eb-9cd479634827","resolution":{"observed_at":"2026-07-10T01:46:40.934444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.707068Z","title":"Veo-3 technical report","venue":null,"work_id":"c424672a-a26b-462d-b025-af5fd16c55f3","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:e340b79af6482eda53c63f24d7b16356d69c21b593a647e4d1e9e1177bf66ab2","observation_id":"b2a5a924-b357-4e98-8ab7-379e66038bf5","resolution":{"observed_at":"2026-07-10T01:46:41.708214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.26802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.958177Z","title":"Are video models ready as zero-shot reasoners? an empirical study with the mme-cof benchmark","venue":null,"work_id":"9b88873e-00b7-4c70-91a0-59d9c610d094","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:d8efeb3e741ff107883d23b8e49ce06c22daab893aea2ce99850daacaafb0e8b","observation_id":"6463ea4a-889b-4a75-ad3f-e0f17b8412e2","resolution":{"observed_at":"2026-07-10T01:46:40.959738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15198","last_updated":"2026-05-14T17:59:55Z","snapshot_observed_at":"2026-08-11T10:03:42.090039Z","submitted_at":"2026-05-14T17:59:55Z","title":"ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both","version":1},"cited_work":{"arxiv_id":"2605.15198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15198","snapshot_observed_at":"2026-07-10T01:46:40.963687Z","title":"ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both","venue":"cs.CV","work_id":"85b864a0-34aa-46fb-8ee2-efe075797146","year":2026},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2605.15198","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:b635c12875396b0cd62b19af57c5b2c9ac42f4cb2575609dd98978c4d625e16c","observation_id":"cd97e1ec-a4f5-4930-a23c-4cc791835aca","resolution":{"observed_at":"2026-07-10T01:46:40.964934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02622","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.955512Z","title":"Ruler-bench: Probing rule-based reasoning abilities of next-level video generation models for vision foundation intelligence","venue":null,"work_id":"6a5f46c0-ed59-4bf5-94f1-c9a715134a78","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:a1ea8d07cfd606420fdd6cd8f4c4c5831153d7278a7d63735fc71d6cce503028","observation_id":"1a65e0b6-ca78-4ed1-a16d-6e96e54fe19b","resolution":{"observed_at":"2026-07-10T01:46:40.957301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":"2511.05271","doi":"10.48550/arxiv.2511.05271","metadata_source":"pith","pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","venue":"cs.CV","work_id":"0bc8f779-a287-4c6f-95b2-daffd15ad044","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:a46960e74bfd34f73ab5a3af7144c005e5fb22d188b1602b7d16cd4e47de73af","observation_id":"e9e10b7e-e588-4610-9a61-d22cbc2a186f","resolution":{"observed_at":"2026-07-10T01:46:40.983972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.374505Z","title":"Lora: Low-rank adaptation of large language models.Iclr, 1(2):3","venue":null,"work_id":"80a84b35-042e-4846-80ca-177dbf9b1b1b","year":2022},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:fde5170dd59bf23a6ab53e40ce8efd5ba279181a8a5d9034586fdf3c84375ddb","observation_id":"11df88a7-3bc2-483d-9b0d-f1daedfc5519","resolution":{"observed_at":"2026-07-10T01:46:41.700940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.695862Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379","venue":null,"work_id":"3f17b1ca-4004-4e88-a10c-ab2b8402c65b","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:3229ae12a729820527c61b89f79dd36db3092c372bfac97424cf3229a4dfd1bc","observation_id":"5d7a631a-470a-42c3-aee0-a34a45a791fe","resolution":{"observed_at":"2026-07-10T01:46:41.697171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-15T09:45:16.680960Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:6b18aacc7e100105eadc287a5ff51368eabdfba07a29d65c48880a98aa2dd679","observation_id":"7a8a1784-94f6-4d85-9bb5-47133c928073","resolution":{"observed_at":"2026-07-10T01:46:40.945808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.693957Z","title":"Large language models are zero-shot reasoners.Advancesin neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":"bd9f32de-c3c0-467d-9dbe-19613dea8617","year":2022},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:fdbf903acabc3af24ba4905e74b6e4426c5b415e5e0be6fcd67ba3c7986d823a","observation_id":"062dbfca-809a-4311-a779-d6b9b3c251ce","resolution":{"observed_at":"2026-07-10T01:46:41.695293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:89eb84e02d39a7ed41d0950bbdf57f9cc8a6c50b74756a1387a6e88c58a4e7dd","observation_id":"c3b4b50d-260e-4c33-8979-ba81089ceac8","resolution":{"observed_at":"2026-07-10T01:46:40.978808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.701505Z","title":"Kling ai: Next-generation ai creative studio.https://klingai.com/, June 2024","venue":null,"work_id":"88de5d2b-a098-44a9-a8cf-1844d78d1693","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:7b9c7bcafb0096082cade19b5e4e4b52370440affb1dcc60a350a47abc9ba582","observation_id":"39325a9b-6503-4a4c-bd97-ab03340701e3","resolution":{"observed_at":"2026-07-10T01:46:41.702717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":"2501.07542","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-07-10T13:37:06.824298Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","venue":"cs.CL","work_id":"fe549c4a-19fa-421a-9a30-230932ba737e","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:4ec437e10c5a922bc6851d2674a21cf5866441af8d3e986f4a82e740a3cae7d6","observation_id":"d877ac51-8731-44a6-80f7-fdadc40eac68","resolution":{"observed_at":"2026-07-10T01:46:40.925629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.987714Z","title":"Thinking in frames: How visual context and test-time scaling empower video reasoning","venue":null,"work_id":"8a65d73d-2c1b-47a2-972d-45a14aa7ad25","year":2026},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:5c2e05d938230604a08532c4ca00a798170f1e9f1aeccd8723a70541fd1e3cf9","observation_id":"c45ac3be-9ebc-4caf-8d91-1f5861551ca8","resolution":{"observed_at":"2026-07-10T01:46:40.989376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.945169Z","title":"Beyond the last frame: Process-aware evaluation for generative video reasoning","venue":null,"work_id":"ed4a8e9d-eaa8-4ff6-84d2-3a92f603be30","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:0f7ca74bdb26eeb097804100f2c5d5ee0b3a25019f3d3fe5333f017bf46a0812","observation_id":"c86affcc-5c45-4d49-9652-8851960cbdd9","resolution":{"observed_at":"2026-07-10T01:46:40.946670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.964095Z","title":"Can world simulators reason? Gen-ViRe: A generative visual reasoning benchmark","venue":null,"work_id":"04240c59-0a34-48a6-8ca3-26dde22f21bb","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:0d51b0a059a046a7b4566d75fb5e67bf7e9b1a7fa993ee84d9f9a71b83be6cee","observation_id":"a2378171-af96-4dfb-a16e-4a3455e26c58","resolution":{"observed_at":"2026-07-10T01:46:40.966106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:8d49dcf33a4781cab4ece838da2768b378549dd5a1836322f44139f1b451bf9c","observation_id":"5ae965ed-4668-48cd-8f50-42c07938ef76","resolution":{"observed_at":"2026-07-10T01:46:40.922981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16668","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.952974Z","title":"V-reasonbench: Toward unified reasoning benchmark suite for video generation models","venue":null,"work_id":"3984f3bb-30d6-40f2-abef-6f2bd8429945","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:60283d90b00ab26374ebd58493e2b57a0efa2547ea6feb78e2bcd3a45cf9191d","observation_id":"1c5f7a11-3783-4f99-b1e5-8d4ff7594325","resolution":{"observed_at":"2026-07-10T01:46:40.954809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.692083Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers","venue":null,"work_id":"a08d2a16-a0ba-4b60-afd1-b5ffb9f4de4f","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:6ef206318a1962f3241129dbe149b0de9211e9e6fa0cafa36527ea4afc445d73","observation_id":"5f7cfce7-c762-4002-8a03-3de86e4b2680","resolution":{"observed_at":"2026-07-10T01:46:41.693365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:9de37da959e1a90f36efe27741a5118ceab8c77526f7f05be4412c0aea2304ea","observation_id":"b600dee4-f4a6-4258-9d8c-f2576be339ce","resolution":{"observed_at":"2026-07-10T01:46:40.973659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.688567Z","title":"Sora 2 system card","venue":null,"work_id":"adc2de91-7845-45e8-8fd5-85b687fed8ab","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:e72d4724f3d60fa9997e35e02dd3d5bd5884c8cf254bf7f854edea28f67e6be1","observation_id":"d97fcd91-3b88-481a-81b3-23eac9c1fee7","resolution":{"observed_at":"2026-07-10T01:46:41.689671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:b8f28296760761d35bba92029d4426a2d3d3388780dfed44c8d1ea7301946903","observation_id":"3080deb3-be58-474c-8580-5bc03a4d6a93","resolution":{"observed_at":"2026-07-10T01:46:41.691493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.20194","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.980081Z","title":"Mme-cof-pro: Evaluating reasoning coherence in video generative models with text and visual hints.arXiv preprint arXiv:2603.20194, 2026","venue":null,"work_id":"01338b42-dd2a-449a-9aa3-ef5e8bf282c1","year":2026},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:df44464d6afc46f746e368f4a2f502210124446432f3aaf7945de361df618741","observation_id":"c8f7bd50-224c-4bc8-9a57-79e870edfdf0","resolution":{"observed_at":"2026-07-10T01:46:40.981614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.705184Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"b114346e-512c-4e00-a712-991c1c5df538","year":2015},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:ecaa9c4bfe55a6aae9b816feb8d0fbc919b01627905846890600e2acf133eb89","observation_id":"c554f99c-a9a5-499b-8b9d-93629e585ffe","resolution":{"observed_at":"2026-07-10T01:46:41.706478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-08-14T12:08:18.712691Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:d457fa0e3bf8e21c1916178d708414c3598ecd6f9957c7fecaee2c2671982395","observation_id":"414590e5-777f-4818-ab82-213f3920114d","resolution":{"observed_at":"2026-07-10T01:46:40.968677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-12T10:49:35.463190Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:37b52840e11ab765f8c4b282cc4c951c94773f52a47208c765ff5f5d39887c83","observation_id":"5dd83c35-a621-42e2-991b-2ddf1ddccd6e","resolution":{"observed_at":"2026-07-10T01:46:40.986572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.686683Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"fb4f6d6f-9a64-482e-8ec3-612a30e5c189","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:733dfe285edbb0b170c8663ef6d8eca205f20c575f4aeeaa3da9960372ef81ab","observation_id":"754f53a1-1095-4b26-9443-797670817931","resolution":{"observed_at":"2026-07-10T01:46:41.687949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.684829Z","title":"Image editing in gemini just got a major upgrade","venue":null,"work_id":"24b2ae20-da82-496c-8fa3-522a72254433","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:a537c8cc5de9df2491aef6b4a6d625b6624fd7952d87acd4037709f1708a5701","observation_id":"7a687809-ffa1-465a-a467-5f64c2433ae0","resolution":{"observed_at":"2026-07-10T01:46:41.686062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:71b57e7dc7d51980351d233968a96216cbb53eced453a6dd8579f77796321641","observation_id":"7a5f0106-3f86-4f6b-bd99-dac096f1d38f","resolution":{"observed_at":"2026-07-10T01:46:40.944092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.595007Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"b5fd43ff-336f-45fd-933c-ffddf3003880","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:909bee9a6b9c5dad7c51dbbe23df4b90f21036775d2fcff80e22990e458d6f80","observation_id":"bb2c96df-62fb-4a1f-9510-3665177844d3","resolution":{"observed_at":"2026-07-10T01:46:41.718006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-08-13T13:40:49.849697Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"cited_work":{"arxiv_id":"2511.04570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04570","snapshot_observed_at":"2026-07-10T01:46:40.976623Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","venue":"cs.CV","work_id":"b327f866-d49b-4e15-aa3f-68b695fc7e47","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2511.04570","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:f5890400286a370fb5c17fe4df556808e0c6f25feef6272dbf097402a5ba1330","observation_id":"d93dd5b9-05b3-40a7-b701-81dc87bb4625","resolution":{"observed_at":"2026-07-10T01:46:40.977806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.710884Z","title":"Attention is all you need.Advancesin neural information processing systems, 30","venue":null,"work_id":"5d33068d-e5da-42bf-a49d-a9ab3895335c","year":2017},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:16316dc2424700f050ed9799494837c9a4e7de9010e5e03ce9da340bf849029b","observation_id":"4320165e-6448-49aa-b662-beb1d6a27e8e","resolution":{"observed_at":"2026-07-10T01:46:41.712067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.712631Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"9e225a90-0e29-4a77-9ba1-bf950857562a","year":2023},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:2da89d9346f498a973ea1438f30a62f0057f252c9c1e469cb02a05d56bccb5db","observation_id":"15fceebf-d8b6-4570-8021-90f0cf75f9c5","resolution":{"observed_at":"2026-07-10T01:46:41.713777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:dba3b0d41b894827d0a8ec0f51a069bde1888f09c92534cdf3f04539e99364cc","observation_id":"9e5b6d57-8719-429f-8121-96e685de7bcd","resolution":{"observed_at":"2026-07-10T01:46:40.980174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.20159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.917858Z","title":"A very big video reasoning suite","venue":null,"work_id":"4cb52917-7539-4575-a350-92645383c4ef","year":2026},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:ca6289e1ed84d44a346276f1c4e72aa54ae9620c7a8b886d818eb0adba3a4775","observation_id":"dc76d491-4e59-4cb6-baca-d3a1fae1a3e1","resolution":{"observed_at":"2026-07-10T01:46:40.919795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.714358Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advancesin neural information processing systems, 35:24824–24837","venue":null,"work_id":"267dba6a-214a-4188-9c1c-185bbe3cf8a7","year":2022},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:4c5b874e06b42e728698b1a345b8ca8f8b2b840a1c44bc6ba82a7d5e8d218ebf","observation_id":"2b3fc277-3f0b-4234-93cf-8483a272a386","resolution":{"observed_at":"2026-07-10T01:46:41.715805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:c7d4c89cd303fcea384b6611f0650469289437b6cf4c603fbc4cdb5e5795189c","observation_id":"8657b9ef-67e8-4500-a5f8-38582f8953d2","resolution":{"observed_at":"2026-07-10T01:46:40.972750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:13603d17b40ac9dc0f1ade55bddc9b450f97f88e75846e3f468f9680093533b8","observation_id":"c0047a30-0832-4b0f-8df6-e7a5a46116af","resolution":{"observed_at":"2026-07-10T01:46:40.933515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.958436Z","title":"Visual planning: Let’s think only with images","venue":null,"work_id":"de8a30bf-f8d1-46d8-b619-a8e07a7503cb","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:bd72e779ffd07f0fa319c6636894b88ede096e3f6e93ccd1654318f9f209fc46","observation_id":"885deb5a-6120-4ae8-906b-f0a07f982aaa","resolution":{"observed_at":"2026-07-10T01:46:40.960034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.947716Z","title":"Reasoning via video: The first evaluation of video models’ reasoning abilities through maze-solving tasks","venue":null,"work_id":"f545bb0a-f733-4043-b88d-269bb91de46a","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:c6e5adb5e343c359a5b0441ecbb5292fe284466aed0c4d5abea6f6ffd0a26572","observation_id":"cba367d6-33e6-403f-9bf3-ca666b0c4672","resolution":{"observed_at":"2026-07-10T01:46:40.949249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.697728Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":"1060a5c8-7de8-4739-97f9-f43b325a698b","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:1fa4a4a9a0aca3908268066bf6e6f893a766f8edc23cd5fe9f20ce265cb2700b","observation_id":"fe13e993-bead-430a-8d8a-d06b6f3d0e08","resolution":{"observed_at":"2026-07-10T01:46:41.699135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.703285Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? ECCV 2024, 2024","venue":null,"work_id":"9bbaf9a6-1172-45c7-ab6f-ce1d7071a7f4","year":2024},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:fecaed6d621b3b625a4d781127b1f6c7d4a8d024a04f72d5c73f69bd0ab04c2c","observation_id":"4627b822-39cc-4b87-984d-7413f66e04e2","resolution":{"observed_at":"2026-07-10T01:46:41.704599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.14362","doi":"10.48550/arxiv.2505.14362","metadata_source":"pith","pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","venue":"cs.CV","work_id":"5f6cf57b-2407-4127-b39c-d8a61494e474","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:966cf82315e18079f200172ecb909f27c91fdeda8dbf0401e76378222a28575e","observation_id":"a231b1ce-35ce-4484-963e-8c973cf20d25","resolution":{"observed_at":"2026-07-10T01:46:40.971205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":31,"verified_fuzzy":18},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2607.08763."}