{"as_of":"2026-08-24T00:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c9f0073912202dc886aa20b9a77627e052723f792bca2e250c73091bae60735","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:57:50.582268Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:59:21.754125Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.916129Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"cited_work":{"arxiv_id":"2506.14821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14821","snapshot_observed_at":"2026-07-04T15:09:54.916129Z","title":"Reinforcing vlms to use tools for detailed vi- sual reasoning under resource constraints","venue":null,"work_id":"0f8bba56-277a-4262-996c-f39fbf9ce72b","year":2025},"citing_paper":{"arxiv_id":"2604.19945","last_updated":"2026-04-21T19:48:19Z","snapshot_observed_at":"2026-08-13T15:38:33.593571Z","submitted_at":"2026-04-21T19:48:19Z","title":"Visual Reasoning through Tool-supervised Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T03:05:21.688216Z"},"links":{"cited_paper":"/paper/2506.14821","citing_paper":"/paper/2604.19945"},"observation_digest":"sha256:5a12a76feab11a8953cabaa4a16841a8a90e9ff45cf3880bf46539a59d20c9a0","observation_id":"d14628f5-581b-44e4-8269-0737da2e3b59","resolution":{"observed_at":"2026-05-11T12:46:03.011383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"cited_work":{"arxiv_id":"2506.14821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14821","snapshot_observed_at":"2026-07-04T15:09:54.916129Z","title":"Reinforcing vlms to use tools for detailed vi- sual reasoning under resource constraints","venue":null,"work_id":"0f8bba56-277a-4262-996c-f39fbf9ce72b","year":2025},"citing_paper":{"arxiv_id":"2606.20980","last_updated":"2026-06-18T23:10:36Z","snapshot_observed_at":"2026-08-13T13:00:40.024997Z","submitted_at":"2026-06-18T23:10:36Z","title":"Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T17:30:07.926246Z"},"links":{"cited_paper":"/paper/2506.14821","citing_paper":"/paper/2606.20980"},"observation_digest":"sha256:68530a48725a8ae38a29a8202fb976ae2ebaf6b0876e8f2a886c24b4ac485e0d","observation_id":"286d5a95-1ac0-460a-8654-e38e7b89ef06","resolution":{"observed_at":"2026-07-04T03:59:32.460615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"cited_work":{"arxiv_id":"2506.14821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14821","snapshot_observed_at":"2026-07-04T15:09:54.916129Z","title":"Reinforcing vlms to use tools for detailed vi- sual reasoning under resource constraints","venue":null,"work_id":"0f8bba56-277a-4262-996c-f39fbf9ce72b","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-17T15:34:17.600386Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2506.14821","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:83683bbdf078d0c5b5a4828a89ee0ff613aea3ef5273412a43bfcf680b4de9c9","observation_id":"caba1028-2cc3-4038-a103-2f69c434e245","resolution":{"observed_at":"2026-07-04T15:09:54.917925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14821","snapshot_observed_at":"2026-08-01T00:59:21.754125Z","title":"Reinforcing vlms to use tools for detailed visual reasoning under resource constraints.arXiv preprint arXiv:2506.14821, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-16T06:50:08.099850Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.754125Z"},"links":{"cited_paper":"/paper/2506.14821","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:e83196d5a37c7d33469753e5464fd20cbc06391fca85df5941dd60f1d752f73b","observation_id":"b16b97a9-0b9a-4018-ab06-12f1346796d1","resolution":{"observed_at":"2026-08-01T00:59:21.754125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14821/citation-record","integrity":"/paper/2506.14821/integrity","json":"/paper/2506.14821/citation-record.json","paper":"/paper/2506.14821"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T04:57:50.340731Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.340731Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:a895399d4e00edebb0c2daf883638fc36e543b4aca0a6bd516e9f8952aacd277","observation_id":"807be10b-9395-4077-8cca-cfe0d2bde021","resolution":{"observed_at":"2026-08-07T04:57:50.340731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:57:50.347226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.347226Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:01ee8a790985113b44dd86d46303f1361efa063a89d917480cc4dc9814f927e0","observation_id":"e80221b9-7f65-44dc-a55c-248078a8b337","resolution":{"observed_at":"2026-08-07T04:57:50.347226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02199","last_updated":"2025-03-04T02:21:07Z","snapshot_observed_at":"2026-08-18T14:40:02.607519Z","submitted_at":"2025-03-04T02:21:07Z","title":"Words or Vision: Do Vision-Language Models Have Blind Faith in Text?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02199","snapshot_observed_at":"2026-08-07T04:57:50.355178Z","title":"Words or vision: Do vision-language models have blind faith in text? arXiv preprint arXiv:2503.02199, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.355178Z"},"links":{"cited_paper":"/paper/2503.02199","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:a54bdc92f33aa22374bae0592c53c80d5bf8fe0b82fa38b0f4c32d99aae07cde","observation_id":"b0fa55a5-b713-49fc-9f3b-ff77372806c6","resolution":{"observed_at":"2026-08-07T04:57:50.355178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T04:57:50.363366Z","title":"Openvlthinker: An early exploration to complex vision-language reasoning via iterative self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.363366Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:924aeeac6773f6007fec8a82e6cd10dcf6ee89749dd44c5ed94da7fbe16c2d85","observation_id":"7d65f2de-5a24-42a4-a984-dd68cf4ac653","resolution":{"observed_at":"2026-08-07T04:57:50.363366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03940","last_updated":"2024-08-07T17:59:40Z","snapshot_observed_at":"2026-08-21T16:10:02.729725Z","submitted_at":"2024-08-07T17:59:40Z","title":"How Well Can Vision Language Models See Image Details?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03940","snapshot_observed_at":"2026-08-07T04:57:50.370077Z","title":"How well can vision language models see image details? arXiv preprint arXiv:2408.03940, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.370077Z"},"links":{"cited_paper":"/paper/2408.03940","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:f5c91a4ed9c8171f889041796fbfcd4c9b021d1f171906b915fbefe9b9cad06d","observation_id":"45647678-922f-44e3-a91a-47a44320d024","resolution":{"observed_at":"2026-08-07T04:57:50.370077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:57:50.376121Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.376121Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:661eafbf348c18c4a51d2d8b624960a6c3463deef221ce6c75c2fbfa66dfed19","observation_id":"6fea62e8-17af-4438-ae76-049c1c4e08f9","resolution":{"observed_at":"2026-08-07T04:57:50.376121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:51.559559Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":"0e276cf4-74d8-45bd-9c42-e2a386bfc903","year":2023},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.386824Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:8a1d179fc907ab0f7862c98de5df48928617c26ef1d51ea68aeebc86facb2d71","observation_id":"115bedb6-730c-4e7a-861e-7d0c591c3f09","resolution":{"observed_at":"2026-08-07T04:57:51.567458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T04:57:50.395418Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.395418Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:2c72b157fe0f5a12a1b235812dab4cf4164de0e06af9568e1716b85720fd7bd7","observation_id":"2376941c-1789-41cd-959f-712c3846433b","resolution":{"observed_at":"2026-08-07T04:57:50.395418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:57:50.403978Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.403978Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:2f4ac4d13fc2c864e852eb6fa7fa31a07cfb68e068a987ee91cd11323eeb62b5","observation_id":"a6b6d596-1516-4e9c-826d-5f380ebd5e28","resolution":{"observed_at":"2026-08-07T04:57:50.403978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T04:57:50.409615Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.409615Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:3cda5a42f07b1ef47898d297c0c8b3b5b35f32275e6c46230c77c7b5758af52b","observation_id":"57dc231c-abb1-4408-ab63-d9983aa0474c","resolution":{"observed_at":"2026-08-07T04:57:50.409615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14920","last_updated":"2025-04-21T07:39:29Z","snapshot_observed_at":"2026-08-20T13:20:48.337453Z","submitted_at":"2025-04-21T07:39:29Z","title":"DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14920","snapshot_observed_at":"2026-08-07T04:57:50.419860Z","title":"Dyfo: A training-free dynamic focus visual search for enhancing lmms in fine-grained visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.419860Z"},"links":{"cited_paper":"/paper/2504.14920","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:f21c7f81590d55519fa39aa42c6a7685e48574c029f0712de06c7c35dbe5b095","observation_id":"fbc78e49-d107-4875-9227-0be3f22a816d","resolution":{"observed_at":"2026-08-07T04:57:50.419860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:50.426006Z","title":"API -bank: A comprehensive benchmark for tool-augmented LLM s","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.426006Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:42d099191765e44dbde1509c778729611c255b5ce77c9fcba2efb6f6b10fb48f","observation_id":"bb934223-e1ef-4b8d-8011-0ad370fc0956","resolution":{"observed_at":"2026-08-07T04:57:50.426006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01487","last_updated":"2024-03-03T11:39:41Z","snapshot_observed_at":"2026-08-16T14:13:21.594298Z","submitted_at":"2024-03-03T11:39:41Z","title":"InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01487","snapshot_observed_at":"2026-08-07T04:57:50.431220Z","title":"Infimm-hd: A leap forward in high-resolution multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.431220Z"},"links":{"cited_paper":"/paper/2403.01487","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:4cf00ba72021ce0eb6026b27077e5310e4a54c7ca7445d9dc5719448ea965910","observation_id":"f8d24794-e0cf-4293-9398-a5e18f4e90df","resolution":{"observed_at":"2026-08-07T04:57:50.431220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09797","last_updated":"2024-04-15T13:54:35Z","snapshot_observed_at":"2026-08-16T14:00:49.422052Z","submitted_at":"2024-04-15T13:54:35Z","title":"TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09797","snapshot_observed_at":"2026-08-07T04:57:50.436455Z","title":"Textcot: Zoom in for enhanced multimodal text-rich image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.436455Z"},"links":{"cited_paper":"/paper/2404.09797","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:1b809b6ddebf0cf916441b5107c5704f7d4f7a06ef8408e9763a385ef7730a29","observation_id":"c58f9d50-3dee-4194-a524-81aad9ff36cf","resolution":{"observed_at":"2026-08-07T04:57:50.436455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-21T23:16:01.799274Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T04:57:50.441648Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.441648Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:c312939b2e7c1955d1df355d669375d07e4e4d1f6434015bfa97e632fb662a48","observation_id":"5c50d509-3051-4a26-a553-5419dcc3eb98","resolution":{"observed_at":"2026-08-07T04:57:50.441648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.31970","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:51.069208Z","title":null,"venue":null,"work_id":"ce121712-76d7-4bf6-99d5-feee2b31fa40","year":2023},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.446995Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:dc82a1718fd47c6c875f2243d88d9fb9f0150dcf27fdfe9abec5dd2d552b0de5","observation_id":"95f5041c-ab15-4854-9ef6-ab890f92ed51","resolution":{"observed_at":"2026-08-07T04:57:51.083101Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T04:57:50.452790Z","title":"Toolrl: Reward is all tool learning needs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.452790Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:c9911e6dd418adc7a17a0197738f69c7d8d7e47542b0e618e2887c1df957a5d1","observation_id":"b419a21e-9801-476d-bbb9-f56277c8cb72","resolution":{"observed_at":"2026-08-07T04:57:50.452790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:51.536935Z","title":"Vision language models are blind","venue":null,"work_id":"179dc961-dbe7-4c05-93bf-0c92adc1ef3d","year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.459936Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:bbbcbfdde59e06a6bce1730c0d364c44cdc40dd50673dc3c41669830187147c0","observation_id":"25f6e155-d836-4c44-84df-d5ef548a87fc","resolution":{"observed_at":"2026-08-07T04:57:51.543102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:57:50.465503Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.465503Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:5218fea2cb0838b54e8986d0057292960a806de4f456a0b4d57dd2eed1ffbfd6","observation_id":"2b432fc9-d0e0-4a6b-85fe-20d7c1df7828","resolution":{"observed_at":"2026-08-07T04:57:50.465503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-08-15T05:00:23.895770Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-07T04:57:50.473467Z","title":"Zoomeye: Enhancing multimodal llms with human-like zooming capabilities through tree-based image exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.473467Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:a98499d74d4ea5ca5ebb81fade1cfe0e2cfa872e075c0539914515d5c9399e2e","observation_id":"52602015-4285-4698-93ab-0b88b0fc2e98","resolution":{"observed_at":"2026-08-07T04:57:50.473467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T04:57:50.480102Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.480102Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:888d77c0105c515a7f48ab72aa8e6d6df292b5f8cd38431cb74b4b0e6936f739","observation_id":"ee95d8b3-e1b9-411a-aca4-e01c330c29ec","resolution":{"observed_at":"2026-08-07T04:57:50.480102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:51.514539Z","title":"Towards vqa models that can read","venue":null,"work_id":"8c41866a-3a36-452e-bab5-73f2705d9062","year":2019},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.487303Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:f31ddf759bd6753e214dc9f940d31c02a87d58e8708d9b44d6aa2587ed48bafe","observation_id":"0fe2aaaa-71ca-4903-873d-9525efa9739c","resolution":{"observed_at":"2026-08-07T04:57:51.521447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-08-16T13:46:54.220691Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-07T04:57:50.493602Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.493602Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:c47468665a76c0ba19365bab5d2f39475248b190b648919c5d389b92bd6ef4e1","observation_id":"4370f78f-ad7e-460a-afac-bbb72edbc717","resolution":{"observed_at":"2026-08-07T04:57:50.493602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:51.487825Z","title":"Eyes Wide Shut ? Exploring the Visual Shortcomings of Multimodal LLMs","venue":null,"work_id":"19cf4c7d-992a-46fb-8883-f67e727a45de","year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.500717Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:bff292b573231000437abe8b44860fa0225ede1f9df82fd210a17450972eb705","observation_id":"bd96d3a5-b0e9-43ea-9bb2-b19e134a2252","resolution":{"observed_at":"2026-08-07T04:57:51.495365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:50.507372Z","title":"Mllm-tool: A multimodal large language model for tool agent learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.507372Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:53f5ebfe9cce879fc33096d742350996f1570e94ca1483409d26f5cb62d1c89c","observation_id":"1cf72b14-1ce3-462a-a7c8-279e6a630443","resolution":{"observed_at":"2026-08-07T04:57:50.507372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-08-17T11:15:45.055944Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T04:57:50.514130Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.514130Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:f9cf26a05827a824c1e1cca05f40bf388ee9abd5194ecc77c3f16c925d141b3e","observation_id":"eddcca11-3e5d-4acd-9b7a-77af903b8cd7","resolution":{"observed_at":"2026-08-07T04:57:50.514130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:50.525845Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.525845Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:3b5bd1f9d62103a7c86bbb7dd055d8d2b052318cfb0a68242e842c5027eb9dcd","observation_id":"810329ef-15bb-457a-8210-5e9744edee3b","resolution":{"observed_at":"2026-08-07T04:57:50.525845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-07T04:57:50.533988Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.533988Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:3f6b8a2b469c4ae09505211abfd65d8d6174df8c3e4e162f3a9bd93e1e6f9eda","observation_id":"2c994aca-7fb1-4127-81e4-3235be072627","resolution":{"observed_at":"2026-08-07T04:57:50.533988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:51.461794Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"44b9db6a-29d3-4375-8e0e-175deb3b5813","year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.540959Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:e5cab4e9f5f6252f993bb6984b9c926499b5c36a1689998164e1638885805179","observation_id":"c1da3e08-99d8-4710-89cf-989299039783","resolution":{"observed_at":"2026-08-07T04:57:51.469386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T04:57:50.546246Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.546246Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:9dab55babfc36c478d5b3d87f521ebaf5afe8472905372234565104442f496b0","observation_id":"a1c98a9e-53d7-41d8-ba19-673014b47b5b","resolution":{"observed_at":"2026-08-07T04:57:50.546246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-08-16T13:20:46.785210Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-07T04:57:50.551997Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.551997Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:c5ebb0fffa93d7bb03eb9d1433917fb10bd4ea4a12d7742b30f2f24f53606a3a","observation_id":"db15b5e0-d7ea-4612-8a4c-0d59a88f5afa","resolution":{"observed_at":"2026-08-07T04:57:50.551997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:51.439966Z","title":"Predicting goal-directed human attention using inverse reinforcement learning","venue":null,"work_id":"c4fa6615-1a32-4a9a-bd94-69549b55c066","year":2020},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.557650Z"},"links":{"citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:9eb01b7d8fe145a24753dd79eb2618c1c63365281a0f8f886bfa9c9f7e89e07f","observation_id":"e7826dbf-e05f-49db-b7d3-180dc53aebe5","resolution":{"observed_at":"2026-08-07T04:57:51.448207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:57:50.563657Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.563657Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:8c9b60c61f88704d61aba3df7cb633295239da2b8c6748130b91bec0ca91d689","observation_id":"b1161c2b-61e7-4430-9521-4776fc732956","resolution":{"observed_at":"2026-08-07T04:57:50.563657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-16T23:37:49.144529Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T04:57:50.569467Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.569467Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:9c98d716595bb5dd0d58f2bea782af8ab0dd030196ad3cdcec9ddb61be0c89af","observation_id":"b19bc3e2-5c75-401a-aca3-6dbb135c814f","resolution":{"observed_at":"2026-08-07T04:57:50.569467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-07T04:57:50.575266Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.575266Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:070bdd5a3f998dbf719a125344fc1bd73ed58a756c2cfe51d702b2b127b643d0","observation_id":"90a9cec5-14ed-48b0-9266-55363b3a1af6","resolution":{"observed_at":"2026-08-07T04:57:50.575266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-21T07:49:59.038746Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-07T04:57:50.582268Z","title":"thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.582268Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:037e57e8d521afaafc60d3017a6621df27bd13135ae765ca6aa9115f6e9a7bfb","observation_id":"36bcf9ab-8f31-4149-b913-3657639cb1dd","resolution":{"observed_at":"2026-08-07T04:57:50.582268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 4 inbound Pith citation observations for arXiv:2506.14821."}