{"as_of":"2026-08-12T14:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:677a84423072a8d61d2690f8dcf60a073b23efd7beb01176af7e3c2cbf262951","coverage":[{"denominator":129,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:53:14.503030Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09682/citation-record","integrity":"/paper/2608.09682/integrity","json":"/paper/2608.09682/citation-record.json","paper":"/paper/2608.09682"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.922601Z","title":"Latent reasoning with supervised thinking states.arXiv preprint arXiv:2602.08332, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.922601Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:b7737bc39aa8bd13c905a588293113b098cbbbee1bd6e58b30b8d9b79cb2bd1a","observation_id":"21d126e9-bc08-49be-ac7a-28c7872f3451","resolution":{"observed_at":"2026-08-11T12:53:13.922601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.930040Z","title":"Acloserlookatbiasandchain-of-thought faithfulness of large (vision) language models.arXiv preprint arXiv:2505.23945, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.930040Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:97f45c0e3c8f071398fafcea1b9dcfd287026bd5a43e8e735ccec124328f462c","observation_id":"3b40b537-9d4c-4dae-87c7-72e0cbaead1d","resolution":{"observed_at":"2026-08-11T12:53:13.930040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T12:53:13.935715Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models.arXiv preprint arXiv:2403.06764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.935715Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:15b75f462db05e7e692f12df30d8aef462da9971ae2953d4cf15986fe9e3fb0a","observation_id":"54c530f6-4381-45b3-8282-d55da1520d61","resolution":{"observed_at":"2026-08-11T12:53:13.935715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.941754Z","title":"MMStar: An evaluator-centric benchmark for multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.941754Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:71ba6413195c600e6c4986997eef56133fad728802bc2c3b1f992a0f89431515","observation_id":"4127ec8f-cb29-49ef-bf11-6a0e20ae4c03","resolution":{"observed_at":"2026-08-11T12:53:13.941754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.947142Z","title":"Perception before reasoning: Two-stage reinforcement learning for visual reasoning.arXiv preprint arXiv:2509.13031, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.947142Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1bcfba21e36cadffcc7634a2940db2921f1925a9c2b541b11b2794cc6330dedd","observation_id":"e3a06ba7-1a84-4d28-9062-55bd6db2c470","resolution":{"observed_at":"2026-08-11T12:53:13.947142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-11T01:19:00.494448Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-11T12:53:13.952698Z","title":"Bowman, Jan Leike, Jared Kaplan, and Ethan Perez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.952698Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:62c4862d9028623b18e44b84819d366ba48388915311675bac8ddcccd1241e9c","observation_id":"c1d6048d-a793-41d2-8a99-295b545a062e","resolution":{"observed_at":"2026-08-11T12:53:13.952698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18842","last_updated":"2026-08-05T03:43:15Z","snapshot_observed_at":"2026-08-11T04:36:14.038696Z","submitted_at":"2025-05-24T19:30:47Z","title":"v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18842","snapshot_observed_at":"2026-08-11T12:53:13.959442Z","title":"v1: Learning to point visual tokens for multimodal grounded reasoning.arXiv preprint arXiv:2505.18842, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.959442Z"},"links":{"cited_paper":"/paper/2505.18842","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c3810d461c813a0e40c8bf34247efcf7aea3dfa71554981e97c2a86509e1466a","observation_id":"527f98d2-c979-4acc-b913-fbf7eec197af","resolution":{"observed_at":"2026-08-11T12:53:13.959442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T12:53:13.964796Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.964796Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:0dbfcf570cc399d38dceedec74f3ff168848a739bf8915e6b4b8c16b9be7f404","observation_id":"4b2e1502-e09d-4db2-af0d-9f9e3250c7e9","resolution":{"observed_at":"2026-08-11T12:53:13.964796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-11T12:53:13.970205Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.970205Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:83f212077510eb8cb71c0cf517c1b6ef62443ae1056809dae9886367648d5bd5","observation_id":"509a382a-9523-41ba-98f9-4c79aa25a0ef","resolution":{"observed_at":"2026-08-11T12:53:13.970205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-12T03:33:59.313788Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-11T12:53:13.978385Z","title":"Virgo: A preliminary exploration on reproducing o1-like MLLM","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.978385Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:b5b4691f73b0e3803640f2fcc79de34583a510e58e378990f1c6e2e5d852538e","observation_id":"93107529-ff1e-4d89-8ff6-a0d9f5579f93","resolution":{"observed_at":"2026-08-11T12:53:13.978385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.984603Z","title":"Revisiting the necessity of lengthy chain-of-thought in vision-centric reasoning.arXiv preprint arXiv:2511.22586, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.984603Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:6f9a9e0eed179a16100df1b63df7d739c226a203be0bc23609987ab9820d2a4f","observation_id":"65d3ed44-1f15-4843-b40c-8316c5ac469c","resolution":{"observed_at":"2026-08-11T12:53:13.984603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.990131Z","title":"VLMEvalKit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.990131Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:0ce52de90fa16d03e219c8f7c83eb09ccff9eac0ad60f45690de87c37acd34c7","observation_id":"be44b9db-1f68-4022-8868-c22a5ce9043b","resolution":{"observed_at":"2026-08-11T12:53:13.990131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-08-12T14:09:31.044610Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15879","snapshot_observed_at":"2026-08-11T12:53:13.996266Z","title":"GRIT: Teaching MLLMs to think with images.arXiv preprint arXiv:2505.15879, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.996266Z"},"links":{"cited_paper":"/paper/2505.15879","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8534165fdff061303304532e2e7b8012e994dd2cf14b6ab79477cb80d5533f54","observation_id":"7931aa8e-29c5-4a9f-9949-92b81a812407","resolution":{"observed_at":"2026-08-11T12:53:13.996266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T10:58:22.856573Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-11T12:53:14.002043Z","title":"Reward shaping to mitigate reward hacking in RLHF.arXiv preprint arXiv:2502.18770, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.002043Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e1336acb4c068fbc03855b1018bb83da9ea1912aa72779439019d17c806abc24","observation_id":"9056dd3f-3141-49d4-8937-2bf9ac597373","resolution":{"observed_at":"2026-08-11T12:53:14.002043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-12T09:24:32.590340Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T12:53:14.008737Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.008737Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1ffb2b17460275ce0fa6f64421439c6299b9e807436770a39e80cc5d24126e60","observation_id":"195d31a5-11c3-492e-af18-b14ebf648ec6","resolution":{"observed_at":"2026-08-11T12:53:14.008737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.016201Z","title":"Thinking with deltas: Incen- tivizingreinforcementlearningviadifferentialvisualreasoningpolicy.arXivpreprintarXiv:2601.06801, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.016201Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:23de19a9826211dd3180116338a71863bcfa9c8939f3543fa24c1d88568e6c52","observation_id":"64d7c8d5-a9f5-446f-ab58-b427e8915449","resolution":{"observed_at":"2026-08-11T12:53:14.016201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T12:53:14.021564Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.021564Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:efd705143bec3b96cbccdbb39ab74ae925f0892fbc605911c0e0a24ec135c052","observation_id":"068e1c91-7dab-46d4-be3a-3a5502407ccd","resolution":{"observed_at":"2026-08-11T12:53:14.021564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26752","last_updated":"2026-05-12T15:07:13Z","snapshot_observed_at":"2026-08-10T21:24:02.782965Z","submitted_at":"2026-04-29T14:49:37Z","title":"GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26752","snapshot_observed_at":"2026-08-11T12:53:14.026958Z","title":"GLM-5V-Turbo: Toward a native foundation model for multimodal agents.arXiv preprint arXiv:2604.26752, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.026958Z"},"links":{"cited_paper":"/paper/2604.26752","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:75cd846b39007410aa2162a11c055cace76ed9ce4106710f159a9ae31b44da65","observation_id":"a332fe5b-83bd-4f84-a92e-1559c14595f7","resolution":{"observed_at":"2026-08-11T12:53:14.026958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.032344Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.032344Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8782bfe92e83141a229d9244f427f49c26908621a1f2014e98f88f32d8f3061a","observation_id":"0456dc97-cbd6-472e-9331-b839f796af49","resolution":{"observed_at":"2026-08-11T12:53:14.032344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-11T12:53:14.037446Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.037446Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:6b2b5d01b1b765013f2ae22762bee242a3e9c85f2a6eb00ff73c0cfad4d42716","observation_id":"e15c4967-d4e1-4555-9a7d-b39829d8404d","resolution":{"observed_at":"2026-08-11T12:53:14.037446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-11T12:53:14.046256Z","title":"DeepEyesV2: Toward agentic multimodal model.arXiv preprint arXiv:2511.05271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.046256Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8d32364e2545cb98a52f3e49284be19618704dd56dad50c2d6f4142ca6f272f1","observation_id":"661bcc98-115d-42d1-af70-47b2e98f38f0","resolution":{"observed_at":"2026-08-11T12:53:14.046256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.052496Z","title":"Hollon, and Bryan Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.052496Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:a1f3d4becd34f42b7e3443a82548fe369d3390036db43fbba11bb87e0385bcb3","observation_id":"caeb8699-53c6-4525-ae64-b3f61ae401e4","resolution":{"observed_at":"2026-08-11T12:53:14.052496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-12T04:01:40.346811Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-11T12:53:14.059008Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.arXiv preprint arXiv:2406.09403, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.059008Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:be408f74678490798b346033d8035ddf8dd1bfd9e7adae8b0e23bc2d93fd3868","observation_id":"24edadf1-b96c-40e0-b450-1d1055e80bc6","resolution":{"observed_at":"2026-08-11T12:53:14.059008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.065378Z","title":"VerlTool: Towards holistic agentic reinforcement learning with tool use.arXiv preprint arXiv:2509.01055, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.065378Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f9e21076237223f0e951aeecb6b371fc952e867deda8a8b5fb8ec29025fb5a30","observation_id":"2688c6b2-61ba-4f3a-b127-b6d76bfd8826","resolution":{"observed_at":"2026-08-11T12:53:14.065378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-11T12:53:14.072026Z","title":"Kimi K2.5: Visual agentic intelligence.arXiv preprint arXiv:2602.02276, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.072026Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c822fa388d62ef62dda06f5316380998a35a17185ee898557c62548a3315d47e","observation_id":"59f00b1d-851b-48ac-9c49-cf03c313ff85","resolution":{"observed_at":"2026-08-11T12:53:14.072026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-11T12:53:14.077712Z","title":"Mini-o3: Scaling reasoning patterns and interaction turns for visual reasoning.arXiv preprint arXiv:2509.07969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.077712Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:fc5c1da06dfb81d8e00b079cace825f31e08c3f255544f563d353c0e99b3f315","observation_id":"b105647b-87f3-4fb7-82bf-6f0446626b1f","resolution":{"observed_at":"2026-08-11T12:53:14.077712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-11T12:53:14.083137Z","title":"Bowman, and Ethan Perez","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.083137Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:48fee969a1ca31c2c2768f403bfcd4139331584a8dcc9809a290afc1369cf1e0","observation_id":"2897de1e-e8b0-45dd-9850-acec5ccdf6bc","resolution":{"observed_at":"2026-08-11T12:53:14.083137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.088153Z","title":"Zebra-cot: A dataset for interleaved vision language reasoning.arXiv preprint arXiv:2507.16746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.088153Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:87bddad1bf23696f279dc2982452c0f62b1d530f3f6a3d2e680f9e1c32c7bfa7","observation_id":"35cf9fd5-68e4-40d2-972e-a5679640d9ca","resolution":{"observed_at":"2026-08-11T12:53:14.088153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.092965Z","title":"Tir-bench: A comprehensive benchmark for agentic thinking-with-images reasoning.arXiv preprint arXiv:2511.01833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.092965Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:02f225b6f19bba3a7494262bde1eec1d2a2f572c0a40832740d01fade1ed256c","observation_id":"76d54afa-1dd1-45c7-bd61-5613d7a3532b","resolution":{"observed_at":"2026-08-11T12:53:14.092965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-11T12:53:14.097596Z","title":"Seg-zero: Reasoning-chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.097596Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:b137c871c6c7b7b1af4383dffc6515f96734f4a8c2a49be3963d78f11b1f9bef","observation_id":"6155944d-2c98-4ebf-ac10-b83d52418bbb","resolution":{"observed_at":"2026-08-11T12:53:14.097596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.102763Z","title":"On the faithfulness of visual thinking: Measurement and enhancement.arXiv preprint arXiv:2510.23482, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.102763Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:cb12c4db4af9f182759bd42be6d711ddbf96b15bafd4587ae5da3f8797e922b0","observation_id":"8c4c7087-0bf3-4c1c-ba1f-f214947de793","resolution":{"observed_at":"2026-08-11T12:53:14.102763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-08-10T12:01:03.840214Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-11T12:53:14.107674Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.107674Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:435dabf979fd783fa51c44c7017b9d1799311f704c5ab4e150092d7467a3da2e","observation_id":"fed3ace4-7f7a-4068-a766-df90f1678d4d","resolution":{"observed_at":"2026-08-11T12:53:14.107674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.113186Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.113186Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:912abf7d44855809b26a9d93090f7887ad041ed811e08567f9607e27044a3aea","observation_id":"62e485d8-49de-4c3a-9605-ae3b6734b188","resolution":{"observed_at":"2026-08-11T12:53:14.113186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-11T12:53:14.118396Z","title":"Reasoning models can be effective without thinking.arXiv preprint arXiv:2504.09858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.118396Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:88ddc3babc9479f2b0a2ac0659dd920e3f7ec07d0f14f74880baa27b62882856","observation_id":"9004a401-c7d2-49cc-ba01-b07b1b464f24","resolution":{"observed_at":"2026-08-11T12:53:14.118396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01334","last_updated":"2026-05-21T13:03:08Z","snapshot_observed_at":"2026-08-10T10:27:06.939498Z","submitted_at":"2026-02-01T17:00:50Z","title":"What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01334","snapshot_observed_at":"2026-08-11T12:53:14.125300Z","title":"What does vision tool-use reinforcement learning really learn? disentangling tool-induced and intrinsic effects for crop-and- zoom.arXiv preprint arXiv:2602.01334, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.125300Z"},"links":{"cited_paper":"/paper/2602.01334","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1ab9e3fac2eb743d547ccf77d56329c2db16a8092fcc712aec4b67f1d30945b2","observation_id":"87e7c981-a900-4a4f-9443-7f23e41f7676","resolution":{"observed_at":"2026-08-11T12:53:14.125300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T12:53:14.131378Z","title":"ChartQA:Abenchmarkfor question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.131378Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c25a7c8c1839942be2e2b35b371deea96fa7e7d54b5da7e3266f32a016fd0455","observation_id":"8c9b6ca7-8c46-4542-b286-5c2210ec5976","resolution":{"observed_at":"2026-08-11T12:53:14.131378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-11T12:53:14.137144Z","title":"GSM-Symbolic: Understanding the limitations of mathematical reasoning in large language models.arXiv preprint arXiv:2410.05229, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.137144Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c2abd81efb5db64dec5e9dbf792933c792a6f0ded6a71a51f3b130c3e5d1e535","observation_id":"d915d33d-2552-490f-b362-54b7e010fd32","resolution":{"observed_at":"2026-08-11T12:53:14.137144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-11T12:53:14.143566Z","title":"Show your work: Scratchpads for intermediate computation with language models.arXiv preprint arXiv:2112.00114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.143566Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:4be6b68347b42b3aa2aa2e770132288feefcc66c98b5df272457fef133c31c9e","observation_id":"38d5594e-04c8-45a8-9b98-56a44e4122d7","resolution":{"observed_at":"2026-08-11T12:53:14.143566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T12:53:14.149920Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.149920Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:231da2ae370d29fbe91b634d0f7adabaf6e3ef78cbf47a3c2110031c9018ead6","observation_id":"ab05b758-cb33-47e7-92ea-c69c2c1dc7d4","resolution":{"observed_at":"2026-08-11T12:53:14.149920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.156357Z","title":"Thinking with images.https://openai.com/index/thinking-with-images/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.156357Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:cf4f635e9d278893a7f7b2783d96ac821eb96053fcf1891b84621063f3a36122","observation_id":"29b9e7f1-eedf-448c-beb2-59ffb461b6e5","resolution":{"observed_at":"2026-08-11T12:53:14.156357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.161693Z","title":"Do MLLMs really see it: Reinforcing visual attention in multimodal LLMs.arXiv preprint arXiv:2602.08241, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.161693Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f8840cf8208e01181642dee43b049b12885e8241921df687da0340aaf348a017","observation_id":"7a9f1ba0-82a1-4a24-ae45-3cfb98252cde","resolution":{"observed_at":"2026-08-11T12:53:14.161693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-10T05:05:46.269079Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-11T12:53:14.169132Z","title":"Cogcom: A visual language model with chain-of-manipulations reasoning.arXiv preprint arXiv:2402.04236, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.169132Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f661f7f759112044c372ea839cd3a5322a88702f2c4e6238b684a4ea315027a6","observation_id":"c9a368e4-f37a-4ffd-b1d6-20ad3b5f427f","resolution":{"observed_at":"2026-08-11T12:53:14.169132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T12:53:14.175515Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.175515Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:2258983f1f6ec9c2dfe69479cbe1fbbe4cb40adbd1269db5a6491d78d15a0aa5","observation_id":"d47f3c4d-f832-4c6b-a745-c38dbd5f852b","resolution":{"observed_at":"2026-08-11T12:53:14.175515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T12:53:14.182177Z","title":"Qwen2.5-VL technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.182177Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:981f7c4876a90adbf938298b120dda53c8ca65c636986b5dc91665d793ae432f","observation_id":"25ad21de-9c81-4709-b03a-9f0f39708c29","resolution":{"observed_at":"2026-08-11T12:53:14.182177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T12:53:14.188571Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.188571Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:997a1988c288386ef773e0c509fcd6ab55c9b4b345a9e9abe44ad2f5bbb20eb0","observation_id":"8c0aada3-d18d-4ebe-83af-b05f2c1bd462","resolution":{"observed_at":"2026-08-11T12:53:14.188571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T19:28:02.997514Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-11T12:53:14.194557Z","title":"Vision language models are blind.arXiv preprint arXiv:2407.06581, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.194557Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:666bdf802618fe75e4824065d71a564e8c0a337dc98daef6f0a18256d9ba6b9c","observation_id":"fa21b7df-5558-4e33-8163-a62a77acc62f","resolution":{"observed_at":"2026-08-11T12:53:14.194557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23678","snapshot_observed_at":"2026-08-11T12:53:14.200723Z","title":"Tarr, Aviral Kumar, and Katerina Fragkiadaki","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.200723Z"},"links":{"cited_paper":"/paper/2505.23678","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:5cb15444869085bb27eb41137d680f9f2b1b7876b7667f536ba17942b8e2c71c","observation_id":"b553977f-9a03-4e10-9724-7816c539dd03","resolution":{"observed_at":"2026-08-11T12:53:14.200723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.206226Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.206226Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:76ff93dbadefcc4ceb153e5ca6c8d82fd134e016d90b5f1f8498e34516086e63","observation_id":"71aed7c4-6d94-4238-a052-da220eee155a","resolution":{"observed_at":"2026-08-11T12:53:14.206226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-11T12:53:14.211374Z","title":"Visual CoT: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.211374Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:0c92e4189a01b331d64ee9b74f31e690f517ec05f28b67625022b4db48c67690","observation_id":"eb554f4a-9642-4522-ac1f-13538d74085c","resolution":{"observed_at":"2026-08-11T12:53:14.211374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.216761Z","title":"HuggingGPT: Solving AI tasks with ChatGPT and its friends in Hugging Face","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.216761Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:dc9453ed56fdff0c0085a77677404c879aa3eb28679ebb203fc82ada0a5567e1","observation_id":"36606029-2231-4dbc-87b7-538e2926826a","resolution":{"observed_at":"2026-08-11T12:53:14.216761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-11T12:53:14.221402Z","title":"HybridFlow: A flexible and efficient RLHF framework.arXiv preprint arXiv:2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.221402Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8e8f38f091bdabee84609ec355bc9143179f4aca3cdc4c4c1ae4b30434ddbcd0","observation_id":"d80610d9-2730-4bd8-bb41-1c6a246f93d8","resolution":{"observed_at":"2026-08-11T12:53:14.221402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.226408Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.226408Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c3bbecce2e52adb412b16879a20fe7d89c48c93a66bf2a12288b41e0c3fad6d7","observation_id":"7039400c-ff0f-4515-a00c-e38454fb4b39","resolution":{"observed_at":"2026-08-11T12:53:14.226408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16475","last_updated":"2026-06-04T06:19:39Z","snapshot_observed_at":"2026-08-06T12:27:17.916076Z","submitted_at":"2026-03-17T13:01:44Z","title":"Breaking the Chain: A Causal Analysis of LLM Faithfulness to Intermediate Structures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16475","snapshot_observed_at":"2026-08-11T12:53:14.231434Z","title":"Breaking the chain: A causal analysis of LLM faithfulness to intermediate structures.arXiv preprint arXiv:2603.16475, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.231434Z"},"links":{"cited_paper":"/paper/2603.16475","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1ae7576254acf3a06611619cbd92836b972bf545a58e48155ff3ff02c50e90ae","observation_id":"bd7094a6-99ef-4afb-b609-325ea8259745","resolution":{"observed_at":"2026-08-11T12:53:14.231434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-11T12:53:14.237048Z","title":"OpenThinkIMG: Learning to think with images via visual tool reinforcement learning.arXiv preprint arXiv:2505.08617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.237048Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:070043a05bba30118b9e4a390f29dae5ef2a2d58ae8d43340514f19858d5f616","observation_id":"2f895714-0304-4781-afac-8325cbee7e5e","resolution":{"observed_at":"2026-08-11T12:53:14.237048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-11T12:22:14.746398Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-08-11T12:53:14.243692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.243692Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:d10f1b887ecad22cd8fa2b8b001727e56c717bdac560f76fafc668f81c78b7ce","observation_id":"6adf3fcd-a92f-4e84-9f6c-f35f8fdca13d","resolution":{"observed_at":"2026-08-11T12:53:14.243692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16256","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:16.986166Z","title":"When thinking hurts: Mitigating visual forgetting via frame repetition.arXiv preprint arXiv:2603.16256, 2026","venue":null,"work_id":"d48673b0-60cb-4397-937c-8173cf1226e7","year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.249540Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:cc2d70eba2521de9f2b990257ecbf628bc7a36c9c26f00fdaa5db6c1765f62da","observation_id":"808134bd-c4aa-41ce-8ced-e241ff856bee","resolution":{"observed_at":"2026-08-11T12:53:16.994849Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10693","last_updated":"2026-04-20T08:48:59Z","snapshot_observed_at":"2026-08-11T17:27:36.503770Z","submitted_at":"2026-04-12T15:35:08Z","title":"FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2604.10693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10693","snapshot_observed_at":"2026-08-11T12:53:16.896915Z","title":"FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning","venue":"cs.AI","work_id":"cebc7e68-154b-4a10-8ee0-f473477b1ba4","year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.254925Z"},"links":{"cited_paper":"/paper/2604.10693","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:0f2ec763c7e4f5d43c50245ddd009a5b6144bff6b603867fe99546987440707d","observation_id":"33cfd61d-327a-47bf-831c-7f2f998d7ef9","resolution":{"observed_at":"2026-08-11T12:53:16.902776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.260904Z","title":"ViperGPT: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.260904Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c282448fc51a7cc73329cc267e7337dcdd09f8ac4d0043106b08742771c4d454","observation_id":"a6faa050-844b-4cd5-9dc9-5a37b4bcd364","resolution":{"observed_at":"2026-08-11T12:53:14.260904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.266490Z","title":"CV-Bench: A computer vision benchmark for evaluating visual perception in multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.266490Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:249f8b3a0a0e0ee6d72278d6e5d2aaf36936dff24a309e15cfa0b0b13ce5e045","observation_id":"c664eea2-5da5-491d-a904-af12e5d86968","resolution":{"observed_at":"2026-08-11T12:53:14.266490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.271924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.271924Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c47f7d538d70182b3651b3503bc34c6dbd437e49088413e2ea550ab1971f8c99","observation_id":"984d86a0-d722-4cdd-a983-895defd786b0","resolution":{"observed_at":"2026-08-11T12:53:14.271924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.277132Z","title":"Journey before destination: Visual faithfulness in slow thinking.arXiv preprint arXiv:2512.12218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.277132Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:5e8de679172b6d41431d16bffa457bd321de9cef86b2df8d4fb7ecf1327499b5","observation_id":"cb4caa7c-52de-4d80-8dba-fa757ff24771","resolution":{"observed_at":"2026-08-11T12:53:14.277132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.282612Z","title":"GeoEyes: On-demand visual focusing for ultra-high-resolution remote sensing.arXiv preprint arXiv:2602.14201, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.282612Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:932ad11a2253f8cbd1d849c710daec645ac3f0c1091b118bdef148b011b83846","observation_id":"aa0df45c-08c5-43d0-8474-d7483c923177","resolution":{"observed_at":"2026-08-11T12:53:14.282612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-11T12:53:14.289490Z","title":"Pixel-reasoner: Incentivizing pixel-scale reasoning with curiosity-driven reinforcement learning.arXiv preprint arXiv:2505.15966, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.289490Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:5878b34ab08413a714663fe59bfd7fbddd1769f803502d13a3c85194b59f7f3b","observation_id":"0fcc6dce-7fe1-493b-953e-1838a6248d78","resolution":{"observed_at":"2026-08-11T12:53:14.289490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.295877Z","title":"PLaT: Latent chain-of-thought as planning: Decoupling reasoning from verbalization.arXiv preprint arXiv:2601.21358, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.295877Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:852db03af2152f84ca73e26651209f0f8dc2152637c202b1c6d5664862e71dee","observation_id":"431c9e90-1e5c-4855-8d17-1096829a3f45","resolution":{"observed_at":"2026-08-11T12:53:14.295877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.301424Z","title":"VAGEN: Reinforcing world model reasoning for multi-turn VLM agents.arXiv preprint arXiv:2510.16907, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.301424Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:4ce11df6c38e829e190d88d198b4f631cfe5679f898c4bcc5c8c157c208b9408","observation_id":"13f7fe4e-f9e3-4b26-924d-51d354c8d659","resolution":{"observed_at":"2026-08-11T12:53:14.301424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.307438Z","title":"Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.307438Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:6ce3d683199a137c20be02965ef6a9b6f4198725fbbc6a6161a2ec44ff02e476","observation_id":"155234b5-f117-43e0-ac3f-685adee465c4","resolution":{"observed_at":"2026-08-11T12:53:14.307438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.313080Z","title":"A practitioner’s guide to multi-turn agentic reinforcement learning.arXiv preprint arXiv:2510.01132, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.313080Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:4e15cb2b6b32f123deb28d5fb3b56387a3796f829d769687515a63f8f8aa1b82","observation_id":"ad4de20a-fa87-4e81-a3f1-935df8556f00","resolution":{"observed_at":"2026-08-11T12:53:14.313080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-08-06T20:48:41.058327Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-08-11T12:53:14.318402Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models.arXiv preprint arXiv:2408.15556, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.318402Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:bdac9cd3b2c3db8a7c45a525e90d75ad92eb4b9b6ea4811bd6648432a9e34fb6","observation_id":"7e8456bd-7ef2-4fdb-86cb-b3b5d1e618a7","resolution":{"observed_at":"2026-08-11T12:53:14.318402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.324074Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.324074Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:4962feb765c324cf21417bde13dc98452522b90c421156c01f752c32bb061445","observation_id":"f574102a-4bd5-4cf0-aaab-eeb6bc7aa745","resolution":{"observed_at":"2026-08-11T12:53:14.324074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-05T19:32:10.280396Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-08-11T12:53:14.330057Z","title":"Simple o3: Towards interleaved vision-language reasoning.arXiv preprint arXiv:2508.12109, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.330057Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:757691194accf39f3dce527bd16139defa2aa0d07c6bd83a3cefe520132f1ceb","observation_id":"11876701-c04c-48cb-9602-4d5af4eb6f62","resolution":{"observed_at":"2026-08-11T12:53:14.330057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-10T06:52:44.809057Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-11T12:53:14.335916Z","title":"RAGEN: Understanding self-evolution in LLM agents via multi-turn reinforcement learning.arXiv preprint arXiv:2504.20073, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.335916Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:84174687404af1b44ee8d83d405654b247d32cc5efccd25648207fe8c0341fa0","observation_id":"672af4c4-9a5f-40d2-abde-ad12cb180fd6","resolution":{"observed_at":"2026-08-11T12:53:14.335916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-12T10:23:57.226997Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-11T12:53:14.341547Z","title":"CharXiv: Charting gaps in realistic chart understanding in multimodal LLMs.arXiv preprint arXiv:2406.18521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.341547Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:b2e326138245ac0821529e2f083aa221778b3c0a193c82d9a844669ffd1f4b57","observation_id":"58bc7e5f-585b-444a-b826-0f46909038fb","resolution":{"observed_at":"2026-08-11T12:53:14.341547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.346906Z","title":"V-FAT: Benchmarking visual fidelity against text-bias.arXiv preprint arXiv:2601.04897, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.346906Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8c71be2e5891bca89d5ae1d49ba205258a6124fb0d9415206a3b5e80825d4280","observation_id":"f6834941-8cc1-470f-bd19-d04bb69d18b4","resolution":{"observed_at":"2026-08-11T12:53:14.346906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.352064Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.352064Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:9441d0d372e3154cc683c935bb5756e471a9281cc7ad5b76f2c694dbc5160fba","observation_id":"75cb0d3c-04e6-46b5-a8e7-454ba0800c7b","resolution":{"observed_at":"2026-08-11T12:53:14.352064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.357126Z","title":"Zooming without zooming: Region- to-image distillation for fine-grained multimodal perception.arXiv preprint arXiv:2602.11858, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.357126Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:d7afa9c2dabe851b6f30b8d0f4115b077aadbf926add130749dc3a1a78f79deb","observation_id":"8614fd79-8787-43d5-83b9-21608da229f4","resolution":{"observed_at":"2026-08-11T12:53:14.357126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.362216Z","title":"Visual generation unlocks human-like reasoning through multimodal world models.arXiv preprint arXiv:2601.19834, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.362216Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:76351ad063b3068452102b5fc3594ae0a8cd4dc2335314cc6a666f5247fe9248","observation_id":"10131f61-7daf-46c1-82f6-f0f69697db60","resolution":{"observed_at":"2026-08-11T12:53:14.362216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.367385Z","title":"VTool-R1: VLMs learn to think with images via reinforcement learning on multimodal tool use.arXiv preprint arXiv:2505.19255, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.367385Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c01143f368ed44baf321ee5abcecdb37c567b595668b9a1b08563a9ecbb82c35","observation_id":"812332c9-4101-4395-ad7a-532e7f106164","resolution":{"observed_at":"2026-08-11T12:53:14.367385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-11T12:53:14.372654Z","title":"V*: Guided visual search as a core mechanism in multimodal LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.372654Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:d160186f4b01fc7b90e23d8ecd552a97ccbeaf378b4d87a0864a81ff3973afba","observation_id":"c1358137-74bd-4884-b10f-9687c7390116","resolution":{"observed_at":"2026-08-11T12:53:14.372654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.378336Z","title":"Tool-augmented policy optimization.arXiv preprint arXiv:2510.07038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.378336Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:81a437f2b9c6143ac916e6306d71f3b4f7c78079215570207a92415315c9388a","observation_id":"39fdb19d-0830-48e0-bb5b-af6e36d48e4a","resolution":{"observed_at":"2026-08-11T12:53:14.378336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02477","last_updated":"2024-03-28T23:37:24Z","snapshot_observed_at":"2026-08-09T20:31:51.939524Z","submitted_at":"2023-07-05T17:50:42Z","title":"Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02477","snapshot_observed_at":"2026-08-11T12:53:14.384423Z","title":"Reasoning or reciting? exploring the capabilities and limitations of language models through counterfactual tasks.arXiv preprint arXiv:2307.02477, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.384423Z"},"links":{"cited_paper":"/paper/2307.02477","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:6e1df67c81b6ea82371513fdb0fb2f9f038b5884e537e402caaa1b667d0d3488","observation_id":"d2e8fa83-702f-44e8-bdb0-0b664623ccfd","resolution":{"observed_at":"2026-08-11T12:53:14.384423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-11T12:53:14.390585Z","title":"LLaVA-CoT: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.390585Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c7f250e3f623c886035060afdb534c01e2e7650bd7cb2684417afa980968d5f4","observation_id":"e0bf9a99-100f-4ea1-aa7d-15c558030ec7","resolution":{"observed_at":"2026-08-11T12:53:14.390585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08545","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-08-10T23:18:23.568914Z","submitted_at":"2026-04-09T17:59:57Z","title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08545","snapshot_observed_at":"2026-08-11T12:53:14.396078Z","title":"Act wisely: Cultivating meta-cognitive tool use in agentic multimodal models.arXiv preprint arXiv:2604.08545, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.396078Z"},"links":{"cited_paper":"/paper/2604.08545","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:50d76270febb5b6f4615a85b6cc3c9264c381a82cc5a32ca3bbcf7ea2da3a8cf","observation_id":"68cb5366-89ba-4258-9f1a-99d967af8c4c","resolution":{"observed_at":"2026-08-11T12:53:14.396078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-11T12:53:14.403481Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in GPT-4V.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.403481Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:70bd2b91d7cc32b9bf909f86359f37a8e38e08677588cf0961490dc1dbf45c35","observation_id":"51316cec-d858-4612-af50-38963eb96922","resolution":{"observed_at":"2026-08-11T12:53:14.403481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-11T12:53:14.409420Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.409420Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f2e4718bd368647c3f15c06c81a7407b0af18a948294aac3bd6a1122276afe5e","observation_id":"c22ace32-3b90-4012-b5f8-9e466331462e","resolution":{"observed_at":"2026-08-11T12:53:14.409420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-10T11:05:10.491989Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-08-11T12:53:14.415257Z","title":"VisionThink: Smart and efficient visual language model via reinforcement learning.arXiv preprint arXiv:2507.13348, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.415257Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:377e49b2119e0080e43f7486716882256a1931ce1b371520328657c97bba12ce","observation_id":"5e606f51-b262-42b5-8073-9e895eb919f4","resolution":{"observed_at":"2026-08-11T12:53:14.415257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03019","last_updated":"2025-07-02T14:59:35Z","snapshot_observed_at":"2026-08-12T06:11:43.310913Z","submitted_at":"2025-07-02T14:59:35Z","title":"Look-Back: Implicit Visual Re-focusing in MLLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03019","snapshot_observed_at":"2026-08-11T12:53:14.422649Z","title":"Look-back: Implicit visual re-focusing in MLLM reasoning.arXiv preprint arXiv:2507.03019, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.422649Z"},"links":{"cited_paper":"/paper/2507.03019","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:81ab5bc6ca129329a632480b1f40eb55a0a4fbc74e02329bbb49a45b2529b550","observation_id":"af5e4430-ad7c-4533-b666-a57b79c4825d","resolution":{"observed_at":"2026-08-11T12:53:14.422649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-11T16:12:19.023322Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"cited_work":{"arxiv_id":"2604.06777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06777","snapshot_observed_at":"2026-08-11T12:53:15.658267Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","venue":"cs.CV","work_id":"54731e1a-9618-4838-bc60-2c53f799ed21","year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.428800Z"},"links":{"cited_paper":"/paper/2604.06777","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:a8757de62b1b5a5da60d9440936381d24fe4ef69e9469b7776437d11e51bc897","observation_id":"c46a5d03-1cee-489d-98bd-52fb90f9d5b4","resolution":{"observed_at":"2026-08-11T12:53:15.665161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.434700Z","title":"Thinking with images via self-calling agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.434700Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:5201dd789e5305727c7703c8aa1965e939c74edf5d21085c22c3239f2c3e3215","observation_id":"6dc2fa7b-8836-4961-aa4b-e74d4e6e85d4","resolution":{"observed_at":"2026-08-11T12:53:14.434700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.440324Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.440324Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:5c2666229c0e602e720e174bad7bb7a43855038cf3478c49232bbf2067eaa1a8","observation_id":"ebbc4565-7328-45a9-9e9e-c80012b9984e","resolution":{"observed_at":"2026-08-11T12:53:14.440324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.445645Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.445645Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:56c7da4039c024950b0f824f5512a5bf70ea61db04bae207649f80d82de80628","observation_id":"6e03bf6e-d596-4191-833a-6f05b55e852a","resolution":{"observed_at":"2026-08-11T12:53:14.445645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.450944Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.450944Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:ae987d87d390a3aa5316399300b851b2287429af5fff188ea2583e13b2faf7b5","observation_id":"bb86f08f-a4d6-4b04-937e-b32d0aaac4c4","resolution":{"observed_at":"2026-08-11T12:53:14.450944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.456716Z","title":"ProRL agent: Rollout-as-a-service for reinforcement learning training of multi-turn LLM agents.arXiv preprint arXiv:2603.18815, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.456716Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:cf44ffc032421eec0663bd203d6bce6ce2db1e5a1d0f3b787daafbb19a8dd46f","observation_id":"93488707-e50d-4f90-8a7d-95b8d82a412d","resolution":{"observed_at":"2026-08-11T12:53:14.456716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.462467Z","title":"MM-CoT: A benchmark for probing visual chain-of-thought reasoning.arXiv preprint arXiv:2512.08228, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.462467Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:92dfc1a61a723bd9c993f5448aaecb699b9bdfe14182585484bdffadea2319e3","observation_id":"1da67c1b-6c4a-472f-93ea-6f3d8f059e62","resolution":{"observed_at":"2026-08-11T12:53:14.462467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-11T01:31:42.961611Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-11T12:53:14.468007Z","title":"LLaVA-Mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.468007Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:7d4b2106edcb2f642afaa57818f72cfbf97b96680a0c02157f45b699593b3bc1","observation_id":"1cde152f-f8de-45dd-8e0e-f00f4a94f582","resolution":{"observed_at":"2026-08-11T12:53:14.468007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-11T12:53:14.474606Z","title":"MME-RealWorld: Could your multimodal LLM challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.474606Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1cdbe8bdec5ea14a9f28f33d37bec3cf293ef6f71e5b5a34dc019258c3118cd3","observation_id":"ef2d5d0a-b1e9-435e-9982-f1221d152fad","resolution":{"observed_at":"2026-08-11T12:53:14.474606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-08-11T12:53:14.480733Z","title":"Thyme: Think beyond images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.480733Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:32b63689af4a4bd8c811a2e72483182ebe803089e6a812115453c5b03889770b","observation_id":"c12feb7b-3ba7-47e1-a0bc-5cb150c124f2","resolution":{"observed_at":"2026-08-11T12:53:14.480733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.486447Z","title":"Skywork-r1v4: Toward agentic multimodal intelligence through interleaved thinking with images and deepresearch.arXiv preprint arXiv:2512.02395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.486447Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:fcb9db2982f7233f888ad8eacbf99ebe1b33792badba1a379bbd5e163cab514a","observation_id":"4fb149dd-5d29-49f4-a574-6c1c48b07001","resolution":{"observed_at":"2026-08-11T12:53:14.486447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.491968Z","title":"CM2: Reinforcement learning with checklist rewards for multi-turn and multi-step agentic tool use.arXiv preprint arXiv:2602.12268, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.491968Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:0a9b94c3afc5ff0849176f5392eb13abe83f7e536d9b3d5e84e27dc13792ee92","observation_id":"3a376dd0-d944-496d-b3da-cffe00b77a20","resolution":{"observed_at":"2026-08-11T12:53:14.491968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T12:53:14.497323Z","title":"Multimodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.497323Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:6beef1e058cf221440cabdbdeb6bcc0fddd9c09397200ca4c1b60fc547248ed4","observation_id":"abebf7fd-87a9-4b5f-ad26-07e75afc7002","resolution":{"observed_at":"2026-08-11T12:53:14.497323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12506","last_updated":"2026-05-21T07:28:16Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T01:12:00Z","title":"On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12506","snapshot_observed_at":"2026-08-11T12:53:14.503030Z","title":"On robustness and chain-of-thought consistency of RL-finetuned VLMs.arXiv preprint arXiv:2602.12506, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.503030Z"},"links":{"cited_paper":"/paper/2602.12506","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:2cbbceffea2f86984685312157d325537a62a1088498f26807382c560e6de6f9","observation_id":"754fb110-bb38-4730-85a6-4d1842ee219b","resolution":{"observed_at":"2026-08-11T12:53:14.503030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:17:35.865691Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":129},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 129 outbound references and 0 inbound Pith citation observations for arXiv:2608.09682."}