{"as_of":"2026-08-20T22:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84e6294efd3b8f8981e363f7bc871eb7c80ad886881e15bd9bb57c33bf8429eb","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T21:38:08.719207Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26769/citation-record","integrity":"/paper/2607.26769/integrity","json":"/paper/2607.26769/citation-record.json","paper":"/paper/2607.26769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.533422Z","title":"Kao, Adina Williams, Michael Rabbat, and Emmanuel Dupoux","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.533422Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:6acd82076f5890ad112186a55d4fe48110ae70c3accee9305f4342b399c57cf8","observation_id":"ceea200d-26cc-4835-bebe-0a5c63819f39","resolution":{"observed_at":"2026-07-30T21:38:08.533422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.537659Z","title":"M3CoT: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.537659Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:581ac72de5a3e4b00d4d58c3dc31ed7336bde146e835cbbfd8a4871ca7cd5d80","observation_id":"abc8c243-2b73-43c4-8c2d-9d94347d6c46","resolution":{"observed_at":"2026-07-30T21:38:08.537659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02357","last_updated":"2026-06-01T15:04:25Z","snapshot_observed_at":"2026-08-17T23:09:34.678549Z","submitted_at":"2026-06-01T15:04:25Z","title":"Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02357","snapshot_observed_at":"2026-07-30T21:38:08.541273Z","title":"Do multimodal agents really benefit from tool use? a systematic study of capability gains.arXiv preprint arXiv:2606.02357, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.541273Z"},"links":{"cited_paper":"/paper/2606.02357","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:59ebef4afc1991e6f8b58cb6e81260016e478a858ba8efd9b385d3ff0238b8c8","observation_id":"a9602b30-09bb-41bf-a683-ec629425ae12","resolution":{"observed_at":"2026-07-30T21:38:08.541273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.544761Z","title":"Rbench-v: A primary assessment for visual reasoning models with multi-modal outputs, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.544761Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:76fc80f0302935114ec733ae7ce3c572d2866b1ccab1f299854f8dbab6616e20","observation_id":"7d8bd2ea-cb7d-41ac-9776-b5e389f93bde","resolution":{"observed_at":"2026-07-30T21:38:08.544761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.548069Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.548069Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:cdb9494ee87a880224cd97c28d37466c1c94d0c46ee9d5b8b81e18eb3dc5f01e","observation_id":"ed848c46-b96c-4906-a652-80b2149d984a","resolution":{"observed_at":"2026-07-30T21:38:08.548069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08464","last_updated":"2026-06-07T05:58:39Z","snapshot_observed_at":"2026-08-15T15:16:57.255291Z","submitted_at":"2026-06-07T05:58:39Z","title":"TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08464","snapshot_observed_at":"2026-07-30T21:38:08.553205Z","title":"TVI-CoT: Text-visual interleaved chain-of-thought reasoning for multimodal understanding.arXivpreprint arXiv:2606.08464, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.553205Z"},"links":{"cited_paper":"/paper/2606.08464","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:491fdc774cf09f5bd71f4b7a466997c2544fbc7683608ffebb81fc69c48f6e77","observation_id":"19ec7674-8f35-45b8-9aed-e43058c53d4a","resolution":{"observed_at":"2026-07-30T21:38:08.553205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-20T13:19:33.702351Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-30T21:38:08.556986Z","title":"Smith, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.556986Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:7e77c9e54b8127ea344d909c1ce667d5c1392ff298bf7ab7f395972879df3748","observation_id":"dae03d3e-953e-4dc4-ae66-d125d35e78e8","resolution":{"observed_at":"2026-07-30T21:38:08.556986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.560274Z","title":"MME-CoT: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.560274Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:f98243efd37d7bf921d84627bf9e7f4cce6dd844f960d7af8d9e82e3b46ce746","observation_id":"45c97480-da36-43a6-8444-6bbe2ef7ac27","resolution":{"observed_at":"2026-07-30T21:38:08.560274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.563237Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.563237Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:49523826f06b1ad9a43004a5b64e9ac4532d4bbfa364c840c18acd92ae615c0d","observation_id":"26edf29c-00db-4b42-9e5b-b9cba6e26a89","resolution":{"observed_at":"2026-07-30T21:38:08.563237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.566343Z","title":"DROID: A large-scale in-the-wild robot manipulation dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.566343Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:9471cd0d5af886f26cb51b9344e44a6882f9b19283ff77dc6cdd6d91dd42b80e","observation_id":"8b5cd433-5fda-4e54-8d95-dc95faaa9a25","resolution":{"observed_at":"2026-07-30T21:38:08.566343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.570083Z","title":"Reliable thinking with images.arXiv preprint arXiv:2602.12916, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.570083Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:aa9809ee39c749913ae91791ef7c22864c8abb4ffbf624f26e10be145c81ae24","observation_id":"d4ab71dd-167b-41ec-b3d5-80ef2b4fbedd","resolution":{"observed_at":"2026-07-30T21:38:08.570083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21409","last_updated":"2026-04-23T08:23:25Z","snapshot_observed_at":"2026-08-17T08:23:00.214571Z","submitted_at":"2026-04-23T08:23:25Z","title":"S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.21409","snapshot_observed_at":"2026-07-30T21:38:08.572980Z","title":"S1-VL: Scientific multimodal reasoning model with thinking-with-images.arXivpreprintarXiv:2604.21409, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.572980Z"},"links":{"cited_paper":"/paper/2604.21409","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:bb9462afc423df35c4d87a05af04c5a6e08da8f83b136f5ccba8ec132402d93f","observation_id":"67a9bba5-43ad-4e1f-8ccf-6cf4219b6cd4","resolution":{"observed_at":"2026-07-30T21:38:08.572980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.576140Z","title":"Super-CLEVR: A virtual benchmark to diagnose domain robustness in visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.576140Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:dbb28810e2a39cfccf91fc418b21769c58b8241fdd836c5be6339032aa234fca","observation_id":"6fc47bb5-820d-40b2-8b64-954a4f1816eb","resolution":{"observed_at":"2026-07-30T21:38:08.576140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.578969Z","title":"TwiFF (think with future frames): A large-scale dataset for dynamic visual reasoning.arXivpreprintarXiv:2602.10675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.578969Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:5cc25002840118664f3f46d7090ab8d52d95a95af38f4311d81ed4702732f9b8","observation_id":"027a5dad-9f0d-431b-b61b-eabd304e06e6","resolution":{"observed_at":"2026-07-30T21:38:08.578969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.581883Z","title":"Let’s think with images efficiently! an interleaved-modal chain-of-thought reasoning framework with dynamic and precise visual thoughts.arXivpreprint arXiv:2603.21754, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.581883Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:9d87dd68090facc08c73d266cb3c6ad347c808e465b3ef034bd69804dc377232","observation_id":"550a36d5-e98f-4dc5-a847-930aaaf19aa1","resolution":{"observed_at":"2026-07-30T21:38:08.581883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.584808Z","title":"On the faithfulness of visual thinking: Measurement and enhancement.arXivpreprintarXiv:2510.23482, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.584808Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:b6ee9d6795f2c4603a6596442c16ba3bc0388af28decb58d28358bd0db304608","observation_id":"34a2c605-cbd1-491a-85eb-ce6a73f88ac0","resolution":{"observed_at":"2026-07-30T21:38:08.584808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.587689Z","title":"MathVista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.587689Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:a7f59fe59a377d9b157461fcaeb048fb2b23487b6d8efef58d325a7eef4a9af8","observation_id":"64ea9b14-85c4-4574-bead-124ce19ac16d","resolution":{"observed_at":"2026-07-30T21:38:08.587689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.590463Z","title":"Prism-bench: A benchmark of puzzle-based visual tasks with cot error detection, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.590463Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:d9d2cb0c8e519201776c8fb687a0e39da7ee560b2ddf2369541a0237222b9f72","observation_id":"81730bcf-1afd-4da9-9602-61da1aae1d10","resolution":{"observed_at":"2026-07-30T21:38:08.590463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.593537Z","title":"V-thinker: Interactive thinking with images.arXiv preprint arXiv:2511.04460, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.593537Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:a91a3667f08b5abb9b0655626083f2d2070e5d2362ca43a0311388e41812e0e0","observation_id":"25dadfcb-2293-408d-89ce-9cb6a266b4f7","resolution":{"observed_at":"2026-07-30T21:38:08.593537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.596386Z","title":"Mathcanvas: Intrinsic visual chain-of-thought for multimodal mathematical reasoning.arXiv preprintarXiv:2510.14958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.596386Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:d1ec371888fa46e0992b1c8f45dc8436bdac0a001656989a26176ecc22218690","observation_id":"53241768-9313-4d39-8061-bc396a0728b6","resolution":{"observed_at":"2026-07-30T21:38:08.596386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-18T02:45:25.069356Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-07-30T21:38:08.599382Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.599382Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:3fd4e520a674488b1a4d978433fd992194ac18511cce040b4b4e8ef446181389","observation_id":"ad27c28d-a75e-4e4b-aa7e-abc964918073","resolution":{"observed_at":"2026-07-30T21:38:08.599382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.602477Z","title":"Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.602477Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:e1e9a6eac26c61fcaf5a10b0e8d09ae310b923defe506bdb66e8c987db48ec65","observation_id":"272c90f6-1083-4a6b-9aab-ec9c628fac2f","resolution":{"observed_at":"2026-07-30T21:38:08.602477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.605298Z","title":"Vic-bench: Benchmarking visual-interleaved chain-of-thought capability in mllms with free-style intermediate state representations.arXivpreprint arXiv:2505.14404, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.605298Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:82cbd97b2b0941f90c858d646549a7c5ab33bd85cb1eb3d5bb65c3992a6aa549","observation_id":"29784332-b18d-4693-8f56-eae7f94016a1","resolution":{"observed_at":"2026-07-30T21:38:08.605298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27310","last_updated":"2026-05-26T17:20:05Z","snapshot_observed_at":"2026-08-20T14:06:05.365148Z","submitted_at":"2026-05-26T17:20:05Z","title":"How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27310","snapshot_observed_at":"2026-07-30T21:38:08.608340Z","title":"How and what to imagine? visual thinking in unified multimodal models for cross-view spatial reasoning.arXiv preprint arXiv:2605.27310, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.608340Z"},"links":{"cited_paper":"/paper/2605.27310","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:c9b5b95ee4077d3d95e3aed6227325f2c4694dc982167289d6f85ae23b3781bf","observation_id":"0d11f08f-6272-47f8-8f0b-86454827cea6","resolution":{"observed_at":"2026-07-30T21:38:08.608340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-13T10:27:03.396626Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06777","snapshot_observed_at":"2026-07-30T21:38:08.611674Z","title":"Walk the talk: Bridging the reasoning-action gap for thinking with images via multimodal agentic policy optimization.arXivpreprintarXiv:2604.06777, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.611674Z"},"links":{"cited_paper":"/paper/2604.06777","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:6b5e98b83aa18e73d135a2ea001c5f1d5b2a1e49336fc011a3ca5d2a38498c13","observation_id":"9b906d49-9f1c-4e96-80b6-e2f12fa6e915","resolution":{"observed_at":"2026-07-30T21:38:08.611674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.614768Z","title":"MMMU: A massive multi-discipline multimodal understandingandreasoningbenchmarkforexpertAGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.614768Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:5c313794b71407572fbb88f3f157650a822133f0d7bf0611e77e5b28f24180df","observation_id":"e619ffa4-27fd-44aa-b403-6fdd003eaac2","resolution":{"observed_at":"2026-07-30T21:38:08.614768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.617971Z","title":"VLABench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.617971Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:0022c785495dc1c8c8bf04228ec39269e553f2b781abcaf17ddaa3d129ebb11c","observation_id":"7a47c920-6337-489b-9066-7eeca7643bad","resolution":{"observed_at":"2026-07-30T21:38:08.617971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-07-30T21:38:08.620949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.620949Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:5bb4117d9e467df42d2207c1dada4a500d7a35e78087422819b0e43a2e4854d4","observation_id":"073a3bd0-2d98-4fee-9a1d-aa0a4375f4a4","resolution":{"observed_at":"2026-07-30T21:38:08.620949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.624102Z","title":"Thinking with images as continuous actions: Numerical visual chain-of-thought.arXivpreprint arXiv:2602.23959, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.624102Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:78cb73138c85cfc495d45a11a8a03be58a950ef48dd8c32e8ea3a1e4b8c8d3cf","observation_id":"1c63436e-f1a4-4505-ad89-e5fbdde84415","resolution":{"observed_at":"2026-07-30T21:38:08.624102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-07-30T21:38:08.627112Z","title":"thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.627112Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:50f2a92b9987a6816d8106951c8958f309ca1f8492944de6bac03d4b49fd835f","observation_id":"4d13fa59-de63-489e-8463-8ecb04d257e9","resolution":{"observed_at":"2026-07-30T21:38:08.627112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.630224Z","title":"Whenvisualizingisthefirststeptoreasoning: Mira, a benchmark for visual chain-of-thought.arXiv preprintarXiv:2511.02779, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.630224Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:2c0a0905a3c2dcbe89bfb270819732e51ac6d51d1f395375450adb903ea0c989","observation_id":"3af436eb-a351-4837-8823-d4bd82cac763","resolution":{"observed_at":"2026-07-30T21:38:08.630224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.633014Z","title":"What, whether and how? unveiling process reward models for thinking with images reasoning.arXiv preprint arXiv:2602.08346, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.633014Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:6850f294ab96d6f9b4770a4492dc014601b7f69fcc4d286484d001d8a5f40c95","observation_id":"fd613f3f-87f9-4367-8f0e-00eee46f6ad6","resolution":{"observed_at":"2026-07-30T21:38:08.633014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.636423Z","title":"Never collapse multiple ideas","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.636423Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:a4451c60ce238dbedca2b0559fcb522f571894da483e7d780f17045f834c451c","observation_id":"ea7a89c3-2523-493c-9dfe-df3b26c7a07f","resolution":{"observed_at":"2026-07-30T21:38:08.636423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.639335Z","title":"stress concentration at joint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.639335Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:47ed5558653737f1640dc567391f7948a8d070a0385bf692b1bff8d853fcc204","observation_id":"f3f93aa1-d8f1-41ee-8153-9961409ea493","resolution":{"observed_at":"2026-07-30T21:38:08.639335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.642487Z","title":"Friction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.642487Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:e33f2eecfdf2269697781af2ba1f0dc74df745b906424c22cf872d4ff333524c","observation_id":"ef6d4d3a-c20a-41f5-9c25-f9c99f8e3a68","resolution":{"observed_at":"2026-07-30T21:38:08.642487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.645604Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.645604Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:43294d155d0b1ae294ea96f6718fc043b0650ed70332bfafea70dc9adbe076b3","observation_id":"4a5884a5-7bb6-4ae4-974b-f918cef2afab","resolution":{"observed_at":"2026-07-30T21:38:08.645604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.648644Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.648644Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:50f3a89fb317431fd00112929fc549ef11f23844e53525fc929588938e00562a","observation_id":"08dc0956-b00d-4d40-ad2d-eaf6172f2eb1","resolution":{"observed_at":"2026-07-30T21:38:08.648644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.651535Z","title":"The ‘action‘ array MUST contain exactly one item","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.651535Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:c2f07392d2c4cdb3cd09bbc26a58a15de560e9ede914e64c030110e50dffb002","observation_id":"73371f61-5bda-437e-8158-355095454732","resolution":{"observed_at":"2026-07-30T21:38:08.651535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.654769Z","title":"shape\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.654769Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:59a0e311baccfec8cb322f3b02a212f688470615c89f0e0bdc9ed6c434277a53","observation_id":"c9fb6c98-3648-44e3-9397-bed18c948cfd","resolution":{"observed_at":"2026-07-30T21:38:08.654769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.657639Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.657639Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:3be5f0f423c43a2cd089c918cc8336ff03a1f878acdf978564138694e2dcc224","observation_id":"0163d187-5a0c-4a07-8c62-31d7b7c92983","resolution":{"observed_at":"2026-07-30T21:38:08.657639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.660614Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.660614Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:e63eb8065e7f232d89ed887b0c330323acbb64b49a7649329c8c203257a776a5","observation_id":"eb0d507e-921a-42ac-b5d7-31b20d7a9d1f","resolution":{"observed_at":"2026-07-30T21:38:08.660614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.663340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.663340Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:028fb30036d2320cfad952307c95478b030efa0a65d0727cd81694cee887cfd4","observation_id":"cef1cb31-8a30-44f4-91c4-f4a841973bda","resolution":{"observed_at":"2026-07-30T21:38:08.663340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.666191Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.666191Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:f03029dc89d9d3308a04c5185353d65a31f86a0e8fe2f10a47e6daf45aeda2ea","observation_id":"f09f6f84-41d0-4a1b-9f9e-aa5c50f8b0bb","resolution":{"observed_at":"2026-07-30T21:38:08.666191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.669064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.669064Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:26b5ac48a4862f6d18e0b5e5892047d03836f68bc11f093a73a8bd599f7780cc","observation_id":"c81ec226-fa95-4910-bd17-eb783fbd6bcf","resolution":{"observed_at":"2026-07-30T21:38:08.669064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.671819Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.671819Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:08940570a39fe2b7cb76ce66e060c41a0b6cafdee95b9372a24ea2e31dfb940e","observation_id":"dfabcd36-3d59-4f97-bbd4-0e7f9aa34685","resolution":{"observed_at":"2026-07-30T21:38:08.671819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.674624Z","title":"step\": N,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.674624Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:c979317495a55acf4db93bfdfe30e04f16c7e37fd2a9f2a32edcda14c22f50bd","observation_id":"ed798cd9-3c39-475c-9962-1063a0f46ccb","resolution":{"observed_at":"2026-07-30T21:38:08.674624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.677518Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.677518Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:d7f8c3340cf4e7ebf227d16b49d2bea0ac010a6b9e835ce95a20cee89fea0eb7","observation_id":"b3abdb69-2b02-42de-b2ab-62595c09227b","resolution":{"observed_at":"2026-07-30T21:38:08.677518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.680309Z","title":"question","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.680309Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:084791fd8419b7232913608c0204b21e36d5b5a3363943dc509d3ad4d4f222c1","observation_id":"d865021d-3a72-4605-b188-b4920efaa418","resolution":{"observed_at":"2026-07-30T21:38:08.680309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.683015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.683015Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:32b959c80bb3069f3963d8305d18ab87f59aae37971d9476768218a90c2f79c5","observation_id":"48ff0102-c181-4c95-81ca-5abdfb27fc93","resolution":{"observed_at":"2026-07-30T21:38:08.683015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.685679Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.685679Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:31c015bc828a0b3efbee7c6b7e19a7363a408af976d69b5083a1641e4afc2f7c","observation_id":"66922652-a1bd-4d0d-83ea-e71211668e61","resolution":{"observed_at":"2026-07-30T21:38:08.685679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.688692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.688692Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:aa1bbb9a17a01f279737833c124d23480a72a8de70a595bc2d37b2d388b0ae13","observation_id":"4a31e8a4-eec4-4e35-93d2-87159b70832f","resolution":{"observed_at":"2026-07-30T21:38:08.688692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.691471Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.691471Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:521a552c98e315a9f6f438803160816a8e23819e9b9587488ce77cb517d50176","observation_id":"0171318b-b2a9-4722-847a-39185a9ca77a","resolution":{"observed_at":"2026-07-30T21:38:08.691471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.694204Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.694204Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:701fc9c4f0e10ad1012fb16294fa595280b9ad7411acc0fc6cd34485ef0fae77","observation_id":"19856ffa-3bbf-4bbc-926f-01f3aa63e7d2","resolution":{"observed_at":"2026-07-30T21:38:08.694204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.696981Z","title":"correct\": true or false,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.696981Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:3f7087a9dd080b46720a9c3d52d13383873ae84bbf37a5a22281e8b8e15aed12","observation_id":"7595bf09-4d9a-4ca9-aaaa-80aa95e8860d","resolution":{"observed_at":"2026-07-30T21:38:08.696981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.699621Z","title":"If there is no effective visual operation, use null","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.699621Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:a3c057fa8321ac7a217867d4a32d782d0fe0d0c1d0a2f37b70bc51a950b17dd6","observation_id":"4f89d73d-2acd-44b0-b3ef-64eb57072401","resolution":{"observed_at":"2026-07-30T21:38:08.699621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.702230Z","title":"- 1: The visual action directly targets task-relevant evidence and is useful for solving the question","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.702230Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:caaa3954d47618b07b2a5b3e940b00c50bf438a3d473573d7f19e00557baf808","observation_id":"a0e5dae0-b272-4eb8-8b2f-63125b8636c1","resolution":{"observed_at":"2026-07-30T21:38:08.702230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.705049Z","title":"- 1: The rendered visual state faithfully executes the intended action","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.705049Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:a52eb27a4d80020e56db0a76a5fe1a5bf9388381594e1b218fbd699857ae70b0","observation_id":"8a1a0813-d11b-4d1d-8668-48540d221c93","resolution":{"observed_at":"2026-07-30T21:38:08.705049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.707859Z","title":"key_step_id","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.707859Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:e4deaf0fa71296daaa105859fd30411f4df24f51516231a98477fb8bd9365817","observation_id":"f02bd525-1d62-4e88-b55a-e4607d86d433","resolution":{"observed_at":"2026-07-30T21:38:08.707859Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.711161Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.711161Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:b7a1b568ebd39e24effc17832545a8b3713f27a7fa3cf156cc99a0f499e0dafd","observation_id":"567dba69-5ae0-4abb-96f5-cd620d8946ba","resolution":{"observed_at":"2026-07-30T21:38:08.711161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.713952Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.713952Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:0b00a38f9cea06805dcecc54c49a408accf4b6184aacea636d0fcb9a56b52f3c","observation_id":"033c161a-91ed-4d0b-afdd-2c1b0f6104b8","resolution":{"observed_at":"2026-07-30T21:38:08.713952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.716494Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.716494Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:7df792bdbbad1ce03a4dad606d1aa5272205a0409e1d6031bf5e7df847612469","observation_id":"240a4b35-a912-49af-bca8-25fa75d08216","resolution":{"observed_at":"2026-07-30T21:38:08.716494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:38:08.719207Z","title":"This construction covers high-action/failed-answer cases, rendering failures, partial renders, and weak action selection across all audited models and environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.719207Z"},"links":{"citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:03adefe9afcf2b05ed0301ae26504ba387fa771721a0b34d9697353eb6640e57","observation_id":"463a13b3-6b47-4ae8-bf6b-5bdd88df3907","resolution":{"observed_at":"2026-07-30T21:38:08.719207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T21:38:14.469012Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2607.26769."}