{"as_of":"2026-08-08T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:107be05b875798cce8ef5ffadf5503b2d7b053da04908e09bf411ef62c9e7b07","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:40.120459Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:30:03.053598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.147388Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:4cbda5970c3108440d81520265df1b4528995aff535e148616eab9eac2b9b9d0","observation_id":"aa875bb9-c0b3-41b7-8c59-6dbbba4db11f","resolution":{"observed_at":"2026-05-18T19:21:48.261893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:31b64e2d75b4af913a510e6b8fdb39e079ae47f7552f4925d5c256ee7fb0d6e7","observation_id":"cb67b269-a8a5-41a4-974f-2f01fb059d25","resolution":{"observed_at":"2026-05-15T18:41:30.400550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-02T22:10:49.569781Z","title":"arXiv preprint arXiv:2505.20289 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17665","last_updated":"2026-07-12T17:48:41Z","snapshot_observed_at":"2026-08-08T00:21:51.834899Z","submitted_at":"2026-02-19T18:59:54Z","title":"OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:10:49.569781Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2602.17665"},"observation_digest":"sha256:144326548717070206e361ac5ae833a5da600245ebeb65d34438a412f275f5ab","observation_id":"9b5f1228-cac0-48fb-9481-8f569a5422a9","resolution":{"observed_at":"2026-08-02T22:10:49.569781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T07:14:48.918959Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:1ca728e5d5de8fd50e45547e34fafceabb74131fc86ce79a50a532d3954852e3","observation_id":"36ae82ce-49a7-4938-abca-ade047ceada9","resolution":{"observed_at":"2026-05-13T07:17:29.187051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:47:50.595481Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:cfcc30d0723b0490e20a08893bcebc0681cdb030dba0ebba636acf2701198228","observation_id":"e149e1ea-637f-4b6b-b131-7f05cef92eae","resolution":{"observed_at":"2026-05-14T21:48:00.623176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2605.26861","last_updated":"2026-05-26T11:20:09Z","snapshot_observed_at":"2026-08-02T14:18:12.692996Z","submitted_at":"2026-05-26T11:20:09Z","title":"REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T18:19:10.346738Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2605.26861"},"observation_digest":"sha256:2d78db4d4833832b91647772441c34628285701f10b8cc44b2922d1eb3fbaeba","observation_id":"11fce3b3-03fa-4695-a0bb-17051f699a0a","resolution":{"observed_at":"2026-06-29T18:23:50.702685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:a76cea4d503105ee34b612586144cd4f6a4608b8cf6b8e0f558553687afee36b","observation_id":"de041ff8-84d2-441e-9567-5a8772b38d6c","resolution":{"observed_at":"2026-06-28T20:22:37.695015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:b31405b63db636d63e3198047e572a739cc04fbc52b9803d0ac08ef9cabb7b35","observation_id":"f01cae5e-0002-47e1-b14a-147576225dbe","resolution":{"observed_at":"2026-07-04T15:09:55.149238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-01T00:59:21.527737Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection.arXiv preprint arXiv:2505.20289, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-01T00:59:15.902226Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.527737Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:bfb317d2e42d79509edf54be993faeac66a65eef04244611f5b187d199e5202c","observation_id":"12c40016-1136-4111-a9a1-a24b220f201d","resolution":{"observed_at":"2026-08-01T00:59:21.527737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-08T00:30:03.053598Z","title":"arXiv preprint arXiv:2505.20289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T15:18:33.540973Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.053598Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:c3d5d0a00784c4997b75ac8f54bfffeec5edb8f989fb99e5112fe21693491806","observation_id":"2ecdc0a2-7efb-4598-a93b-4def83e45495","resolution":{"observed_at":"2026-08-08T00:30:03.053598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20289/citation-record","integrity":"/paper/2505.20289/integrity","json":"/paper/2505.20289/citation-record.json","paper":"/paper/2505.20289"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:59:35.679510Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.679510Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:6f17dbbc85e05249954aaffd62f1034a54c1c05d601c42fb6fbd7e7a1cece505","observation_id":"bdd3af60-36f6-4ff6-9905-7332016ec311","resolution":{"observed_at":"2026-08-07T13:59:35.679510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.982650Z","title":"Language models are few-shot learners","venue":null,"work_id":"2189e381-09c9-4e2d-bd4a-9839ec1c86d7","year":1901},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.772704Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:e4e4e7cd50378f5b51bc35f7c3debd04aecada55827fa82d6696869787cdcda6","observation_id":"d08f3d56-2dfc-49e1-80c0-075079462928","resolution":{"observed_at":"2026-08-07T13:59:43.052275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:59:35.839303Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.839303Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:79a424997a8f32c0d5e866ee2ab255110b9eff46e0f257bc6bcc43788b516b3c","observation_id":"ab323fc2-493c-4d18-b486-9882846af7be","resolution":{"observed_at":"2026-08-07T13:59:35.839303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:59:35.888788Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.888788Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:7c9db2947ac1c83c7f7f535c1e0633e0a9f98a70a77a1a1c63b5a6ed07443616","observation_id":"cdba0ffa-9c85-4a20-a6ba-90a550228e0e","resolution":{"observed_at":"2026-08-07T13:59:35.888788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:35.927742Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.927742Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:7aede84de4e0973dfcbc6d667a7a3f51195c4424e62f836c263bb3cfa61d28d1","observation_id":"688941ca-0a04-47d9-b69b-2e2700a5f615","resolution":{"observed_at":"2026-08-07T13:59:35.927742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:59:36.008311Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.008311Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:d84292a596d7781f10662934daad9f446b5ce5299f70f7789d15682cbd5c2aca","observation_id":"afde5757-ba96-4b33-b939-a1c33aab25b7","resolution":{"observed_at":"2026-08-07T13:59:36.008311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:59:36.102797Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.102797Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:64f2c7f1db417de108f57838790f8d51bc74b0096f58f151020d0a552ff8e5ef","observation_id":"e01f5360-5b6f-4a5b-b824-68d7ebcb87cc","resolution":{"observed_at":"2026-08-07T13:59:36.102797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-07T13:59:36.173060Z","title":"Program of thoughts prompt- ing: Disentangling computation from reasoning for numerical reasoning tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.173060Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:874a9e57323796202ed012b9d4ad0a9743e1172f887f465a88d72b00c9a4fce0","observation_id":"3f8024ca-e64d-44f5-8ce5-d7d481dfac4d","resolution":{"observed_at":"2026-08-07T13:59:36.173060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-07T13:59:36.266705Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.266705Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:d294765b2790ad240e998ba91b7e8707b2f30179b943aaac2f03c1c524a1d77b","observation_id":"8de9d6e9-170e-4728-98a1-1e4079043ccc","resolution":{"observed_at":"2026-08-07T13:59:36.266705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.332759Z","title":"Pal: Program-aided language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.332759Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:1a80d774b022d6a243b455fe7f231f7ed2796d4639cf32bd29a9f41a7ed0cc7c","observation_id":"a73f13ec-d452-470f-9684-e0d8ba91a76f","resolution":{"observed_at":"2026-08-07T13:59:36.332759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.714700Z","title":"Gorilla: Large language model connected with massive apis","venue":null,"work_id":"9c4160e8-4320-4364-b1a5-a78ecec793dd","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.414302Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:afda64e910d2985af6b78323ec0ccc3b5f5d50cece406b0b7f4244a52514a460","observation_id":"5e26eaad-20dc-4f94-a5a8-e12345f4ce40","resolution":{"observed_at":"2026-08-07T13:59:42.818668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T13:59:36.478765Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.478765Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:5fbee02779c6d6f9d95b6b1ff77a15669e8a17e9eea954b0efb98517121c9a6b","observation_id":"2fa008a5-8011-47d7-abef-8f08ead072a1","resolution":{"observed_at":"2026-08-07T13:59:36.478765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.556198Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.556198Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:c6b125618b9e9c4dccd075116b51e6a9561b3f8ce5361151b50d2cacd8d28573","observation_id":"8875f002-9e09-4fbc-8494-38984220fb19","resolution":{"observed_at":"2026-08-07T13:59:36.556198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.544117Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"4545e099-3b0f-4b80-a4c3-e54cac1a07b7","year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.625081Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:97e3543c2d72a988ccb693de963093c6ef74813fc1396dfdf5e9376903f5b5ff","observation_id":"9de7870e-40fa-46a8-8b5c-b1aa33c00c86","resolution":{"observed_at":"2026-08-07T13:59:42.614098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.401203Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"39103580-b802-49bc-ad9d-b8e00b60bcc9","year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.697970Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:c1ccb9c769591a9efedf6abfaeffff3a86a4d02165604922c9c463434e89fcaf","observation_id":"bff801ff-b139-4cb6-929f-eeb09cfb4686","resolution":{"observed_at":"2026-08-07T13:59:42.461624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.748773Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.748773Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f95146994574e45829342b72ae1fdd9ccbd80ac7d17db6a0fc35a91cbe43d809","observation_id":"6da95cc0-cc6c-4f67-96b8-8da502b1191f","resolution":{"observed_at":"2026-08-07T13:59:36.748773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11271","last_updated":"2026-04-13T23:08:01Z","snapshot_observed_at":"2026-08-03T02:43:16.180683Z","submitted_at":"2025-02-16T21:18:47Z","title":"OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11271","snapshot_observed_at":"2026-08-07T13:59:36.843545Z","title":"Octotools: An agentic framework with extensible tools for complex reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.843545Z"},"links":{"cited_paper":"/paper/2502.11271","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:0b5b85d055499d2b850f376a0612435c020155b7e23ae83af9650a12675aa263","observation_id":"98792aca-f97f-4bc4-baaa-cb14ae54f20e","resolution":{"observed_at":"2026-08-07T13:59:36.843545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.900888Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.900888Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:e0d010d230962256ba423a7df42d8448ccdcb2161beb3e3baf84da735274ee01","observation_id":"4dd80ee7-9102-4d5c-b7ef-a280e31fca07","resolution":{"observed_at":"2026-08-07T13:59:36.900888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T13:59:36.982009Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.982009Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:058c80f55718c4963f6cc6c34213f599200574eb80ee74bc286547779738fcc2","observation_id":"72fc4b0c-cf1c-40de-a9e1-66826631bbe0","resolution":{"observed_at":"2026-08-07T13:59:36.982009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-07T13:59:37.062514Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.062514Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:bf5f1ea6783981ba5fd8059e4e804bdea199862ea769ff4987e1426cc6fc4f6e","observation_id":"14f40af1-03f3-4515-ba06-7b0a00e206f9","resolution":{"observed_at":"2026-08-07T13:59:37.062514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07566","last_updated":"2021-07-15T19:00:35Z","snapshot_observed_at":"2026-07-06T11:29:34.579530Z","submitted_at":"2021-07-15T19:00:35Z","title":"Internet-Augmented Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07566","snapshot_observed_at":"2026-08-07T13:59:37.132107Z","title":"Internet-augmented dialogue generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.132107Z"},"links":{"cited_paper":"/paper/2107.07566","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f517fc04d95a2187932ade99a76311294e28dc162bb88b23427fc4d264f625d3","observation_id":"28f6d4d3-57c7-46a2-bf52-6987a05e02fe","resolution":{"observed_at":"2026-08-07T13:59:37.132107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:59:37.207212Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.207212Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:9e2e34c2d1f96e2669627e9d855b93a403021d135a361864eca6edb3b04ba780","observation_id":"4aefe993-3f2b-4298-84de-a1e815114d44","resolution":{"observed_at":"2026-08-07T13:59:37.207212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.208967Z","title":"Learning to reason with llms","venue":null,"work_id":"a034a293-76ea-4819-8553-4dbc4dc55463","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.248131Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:96c9c88433b7d756258558b63c334d6ece7bd97619a6018ca64b14921266d23c","observation_id":"410dfcc5-d158-4ba6-8771-3b41ddc00ba4","resolution":{"observed_at":"2026-08-07T13:59:42.275098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:59:37.341748Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.341748Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:2009eee0b8422e968b7d13abf8680d68da36fb1578c663f0c9b9580b35bd9f35","observation_id":"ff8373f4-ace7-4f6b-a2cf-ffe6e4e5a260","resolution":{"observed_at":"2026-08-07T13:59:37.341748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:37.420694Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.420694Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:6f9a6da3665503f253c83239c5ceb6b58733e8b7c5598556dd1bbbba6a84a318","observation_id":"100c0509-79ce-4388-bf35-80bd2e7076ea","resolution":{"observed_at":"2026-08-07T13:59:37.420694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T13:59:37.501506Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.501506Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f3ada9a39c2e8471a3a144e8ed37a5b8c2b23429e4aa9bf0594e17d10b01127c","observation_id":"4c15750b-4aaf-4190-9fda-8f7d5351c0ba","resolution":{"observed_at":"2026-08-07T13:59:37.501506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T13:59:37.624601Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.624601Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:6e92fd2939b9145b999b36b951a9d041da797f7d751e1ded549ab420fe488fde","observation_id":"d494e456-33be-4295-947b-67488fb35dc9","resolution":{"observed_at":"2026-08-07T13:59:37.624601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-07T13:59:37.694952Z","title":"Retool: Reinforcement learning for strategic tool use in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.694952Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:52f8c6bdc0d35f891b4d2dc41f0d4f8ca1e5568336c15da926b155abb48eeddb","observation_id":"7414b3f1-a4ed-4a47-96b6-565e97e5c9cb","resolution":{"observed_at":"2026-08-07T13:59:37.694952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:37.771338Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.771338Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f7ba5da0af71fb0296578805b3a07fbe3e19c2490f093aa22303446f44bae13b","observation_id":"301746a9-4f66-44b0-b061-cd7eb6fe2622","resolution":{"observed_at":"2026-08-07T13:59:37.771338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T13:59:37.840955Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.840955Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:79fefe25df473a5e2b044137587b54863363a1277ecca4d97a420c190f3a329e","observation_id":"c5905332-3d3c-4336-9b61-542c0e738dad","resolution":{"observed_at":"2026-08-07T13:59:37.840955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:37.936932Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.936932Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:3ae9b4117b76246b44f01b435b35b9c52462e410037c678557113f7d1bca181f","observation_id":"79c0902b-3de5-453b-b578-d6bd921dc99a","resolution":{"observed_at":"2026-08-07T13:59:37.936932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:59:38.012150Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.012150Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:47729ad6943a05052112e9efe3455ff5cfdaeff156737b31673f89133a64b948","observation_id":"ed414bfd-688b-4641-afb4-c2a87b98951c","resolution":{"observed_at":"2026-08-07T13:59:38.012150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-03T20:34:57.164411Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-07T13:59:38.116421Z","title":"Unichart: A universal vision-language pretrained model for chart comprehension and reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.116421Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:a04f37ea2ba48989a8b043009e01dce1a72883cef92379074c3d02cd15e3ebbd","observation_id":"13414287-fbf4-4ebc-be64-4472e5db32cc","resolution":{"observed_at":"2026-08-07T13:59:38.116421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10505","last_updated":"2023-05-23T18:28:39Z","snapshot_observed_at":"2026-08-08T00:11:52.450834Z","submitted_at":"2022-12-20T18:20:50Z","title":"DePlot: One-shot visual language reasoning by plot-to-table translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10505","snapshot_observed_at":"2026-08-07T13:59:38.207103Z","title":"Deplot: One-shot visual language reasoning by plot-to-table translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.207103Z"},"links":{"cited_paper":"/paper/2212.10505","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:01f60ed950063a8f6f3a4de3ba4191573119a1ec8b8edcb90b662a1346239393","observation_id":"ad3c211d-e2e9-42da-81f4-cc249b8695fe","resolution":{"observed_at":"2026-08-07T13:59:38.207103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03277","last_updated":"2025-03-14T03:19:00Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:41:02Z","title":"ChartMoE: Mixture of Diversely Aligned Expert Connector for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03277","snapshot_observed_at":"2026-08-07T13:59:38.348879Z","title":"Chartmoe: Mixture of expert connector for advanced chart understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.348879Z"},"links":{"cited_paper":"/paper/2409.03277","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:0251d9329220ad2464a5b506abf6a02f374b957a6dac4ed865656bf3c249c59f","observation_id":"82d21851-fc21-4c4b-a93d-a59872686a91","resolution":{"observed_at":"2026-08-07T13:59:38.348879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.985264Z","title":"The opencv library","venue":null,"work_id":"e3b28845-d63f-40cf-a170-5867f79cfde7","year":2000},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.471275Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:3c7f617cde240c4a7184baf283a6817ae99ae096d537628fec8d99ce2fea001b","observation_id":"3e2e839f-1f4f-446f-8e05-6288e7069970","resolution":{"observed_at":"2026-08-07T13:59:42.104637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.768409Z","title":"Context-aware chart element detection","venue":null,"work_id":"a3463b72-c86e-4e72-8ddf-0d3c8c0d8b41","year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.589707Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:ef326ceb8c7357e9a25099c717b37b6194573f17b951587a04f5828def651cca","observation_id":"09391139-cc9f-4177-b139-9a2919c9105d","resolution":{"observed_at":"2026-08-07T13:59:41.869761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.592257Z","title":"Chartocr: Data extraction from charts images via a deep hybrid framework","venue":null,"work_id":"bab591bd-afae-4629-8197-0145c4258846","year":1917},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.709688Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:84a131a92db19e1339b33e5faf5953f0099a6cfe28ff58603c8ef049e6894551","observation_id":"9a651a89-6b09-4ff8-b9b2-645b107eff7b","resolution":{"observed_at":"2026-08-07T13:59:41.686448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02384","last_updated":"2024-02-15T15:34:51Z","snapshot_observed_at":"2026-08-05T02:56:29.376755Z","submitted_at":"2024-01-04T17:51:48Z","title":"ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02384","snapshot_observed_at":"2026-08-07T13:59:38.807547Z","title":"Chartassisstant: A universal chart multimodal language model via chart-to-table pre-training and multitask instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.807547Z"},"links":{"cited_paper":"/paper/2401.02384","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:b87e241b01715f46ba18774da2d0d97b62be89c3c787ce98c016f888f99480cd","observation_id":"51f9c9fe-6506-45db-9fe9-db05c6fa83c3","resolution":{"observed_at":"2026-08-07T13:59:38.807547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12185","last_updated":"2025-04-27T11:31:23Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T14:48:23Z","title":"ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12185","snapshot_observed_at":"2026-08-07T13:59:38.929113Z","title":"Chartx & chartvlm: A versatile benchmark and foundation model for complicated chart reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.929113Z"},"links":{"cited_paper":"/paper/2402.12185","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:33c705058367f7994c62360810e474cab79318284987ff06eba9492e0b499497","observation_id":"250dc581-5b92-4aa4-9bf2-6ca6872fe5f6","resolution":{"observed_at":"2026-08-07T13:59:38.929113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:59:39.039095Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.039095Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:2e49f64a40af8bcbac20e1467cf068c678ddff995083ecb1d047f582f7dd3767","observation_id":"1d2389d6-7575-4bad-bc9a-1c287df02f90","resolution":{"observed_at":"2026-08-07T13:59:39.039095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.413036Z","title":"Diagram formalization enhanced multi-modal geometry problem solver","venue":null,"work_id":"c1d07447-7d23-4ac1-80cc-449b28bcafeb","year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.114084Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:29c020f068ebc9f15d4850dc786e4f0268172c1a662df36ef630944ff9fe2b9f","observation_id":"a9d18b27-1551-49af-bdd2-6886ad4bac68","resolution":{"observed_at":"2026-08-07T13:59:41.489164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-02T03:18:39.824103Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-08-07T13:59:39.192083Z","title":"G-llava: Solving geometric problem with multi-modal large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.192083Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:8f456a4bc0cbd5521ecc4908063434b61afd72db2fca62bfc19d7c58d1e792a2","observation_id":"aa07cd9b-8274-4328-8380-29586848cb9b","resolution":{"observed_at":"2026-08-07T13:59:39.192083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-07-06T19:08:26.637143Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-08-07T13:59:39.265256Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.265256Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:452c71e1294a1b64a82222cd1d81e0cbb4ca55e4145a956e28e05f2396758c19","observation_id":"5c99f6ec-2a88-4c96-82ec-425ab61a8f4b","resolution":{"observed_at":"2026-08-07T13:59:39.265256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T13:59:39.319182Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.319182Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:100c3f13ceafa548c644bd7819ff5897d017c574f24a76fb29671a57bde8580c","observation_id":"10cac71c-70f2-4a17-9fb6-b6f207e1c2a6","resolution":{"observed_at":"2026-08-07T13:59:39.319182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:39.365404Z","title":"The claude 3 model family: Opus, sonnet, haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.365404Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:c0616fddd9aae2cbd2076a4a29e2d66cd33dce08a00320dd29a56ad8425be807","observation_id":"5ed9a8b4-64cd-4945-92a2-09d1c88075be","resolution":{"observed_at":"2026-08-07T13:59:39.365404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T13:59:39.424086Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.424086Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f071af61656873b5693632d2aac7e3f087e6d75453376429bfd5b211420320b3","observation_id":"dcc3e15b-a8b2-4a86-8408-0a0b0d4808b2","resolution":{"observed_at":"2026-08-07T13:59:39.424086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T13:59:39.471308Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.471308Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:d23bd6bb9d5194d7d415dbbbb2d7980954f12f9bba6c45682fc7fd64fe52e423","observation_id":"3dfde684-e0ac-4615-8c21-75abe6408fa0","resolution":{"observed_at":"2026-08-07T13:59:39.471308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.262942Z","title":"Internvl2: Better than the best—expanding performance boundaries of open- source multimodal models with the progressive scaling strategy, July 2024","venue":null,"work_id":"f96aa23e-739d-4eed-97b7-1f26bbf78c1e","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.533698Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:0bc6a8c8963e9b2985d331f1c4a2175518f2c80197b6c6820b35321ab354fbd9","observation_id":"9a6983b9-d7e6-45de-9416-b3084d58b5e0","resolution":{"observed_at":"2026-08-07T13:59:41.333416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:59:39.588544Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.588544Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f3db0b6f0a76e8989e59a6718c704413d42cd540c7bace43e48ec354dc5cf639","observation_id":"1f86a0a9-77b2-42c9-9c11-5294c7f4e863","resolution":{"observed_at":"2026-08-07T13:59:39.588544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.060698Z","title":"Cambrian-1: A fully open, vision- centric exploration of multimodal LLMs","venue":null,"work_id":"58023d64-7834-4d62-9e4b-0427845bd3f1","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.642125Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:e339d1b5ddd86bddd6eadfe76f98af268f08c601cf41614db8080ecc9bebddcc","observation_id":"6ea81de3-cb5c-44bb-b0c2-ccfb6e8f4fbf","resolution":{"observed_at":"2026-08-07T13:59:41.165486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T13:59:39.719031Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.719031Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:a7a082254fc8989ee4f2d8df681305c278d30617762aa2bcf002f42b3794e727","observation_id":"1b80ee2c-5315-4a66-8ea4-acccf288e58d","resolution":{"observed_at":"2026-08-07T13:59:39.719031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T13:59:39.764847Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.764847Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f87bf5542eb75c0b3ac9d129bd59b06527dc597044a3b8e0ad9773e1c45b990a","observation_id":"f25f61f5-941e-4ba4-9855-539b3bfd3da8","resolution":{"observed_at":"2026-08-07T13:59:39.764847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-08T00:41:26.316141Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T13:59:39.820900Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.820900Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:4cbaf2b1f0cc82f193964cdd8b459cead35ddd4c231158b95da34c50b9154116","observation_id":"3006adf5-42af-4746-b61d-4e572fd8820a","resolution":{"observed_at":"2026-08-07T13:59:39.820900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-07T13:59:39.871961Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems? arXiv preprint arXiv:2501.11284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.871961Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:aec208f1a584dd193f3805b20aa8994bb088c6daa3e983f280d2305df74e1aad","observation_id":"6cec24d0-f256-4c17-9cd9-8c44588cd93e","resolution":{"observed_at":"2026-08-07T13:59:39.871961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:40.843145Z","title":"Improved baselines with visual instruction 15 tuning","venue":null,"work_id":"1821f5a8-614e-46de-a642-dcfed14107c4","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.941166Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:ca40bc3c870c8223617ae4a2b146a55895e5b4fd25ae73cb764afbd19bcb3dd4","observation_id":"a2e7b4b2-2738-4452-a79d-b384cda0cb89","resolution":{"observed_at":"2026-08-07T13:59:40.966064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:40.006031Z","title":"xGen-MM (BLIP-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:40.006031Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:3bba1e7e2bab7eb05d5298b9da641b371834fdb81632468cf1c9faf60f075a10","observation_id":"e1a78340-085f-4938-a3ba-adeab8c7d730","resolution":{"observed_at":"2026-08-07T13:59:40.006031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:59:40.054356Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:40.054356Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:4b7b8e80120f9f3a3eae5ab7942081010b6affcf04ae4181eaa09ad7a1c2261d","observation_id":"5361dfab-5fa2-4314-a908-cde932edbe19","resolution":{"observed_at":"2026-08-07T13:59:40.054356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:40.627965Z","title":"Vision language models are blind","venue":null,"work_id":"20d5fccf-0113-4c4e-b6ca-59996642051f","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:40.120459Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:06eb3d6405a314779f2d31c90b3b0917f2321b22936ecb968770e364678ddd8e","observation_id":"248a11fb-53c1-4729-a873-46e668f615f3","resolution":{"observed_at":"2026-08-07T13:59:40.721505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 10 inbound Pith citation observations for arXiv:2505.20289."}