{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd64a9413faf10772e19ed9a2458623b58952753cba50fd8d996c13c0641252d","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:21:37.751127Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02217/citation-record","integrity":"/paper/2608.02217/integrity","json":"/paper/2608.02217/citation-record.json","paper":"/paper/2608.02217"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:30.585410Z","title":"frontal lobe","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:30.585410Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:0580f93490af17e1386ce37db8f3c03c2f54f778b5c27f607f22ff2b9bed0a6c","observation_id":"8faa88f4-15f3-4499-b9e0-20fc7242b5de","resolution":{"observed_at":"2026-08-04T11:21:30.585410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-07-06T21:49:47.325553Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-08-04T11:21:30.691752Z","title":"arXiv preprint arXiv:2506.23918 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:30.691752Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:938e7271d36850edb3dc691dae8e0e19aedb6a4ae6400999f39f003a6a72e7aa","observation_id":"0bea3020-ad66-4744-aa3d-4e3758856636","resolution":{"observed_at":"2026-08-04T11:21:30.691752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12538","snapshot_observed_at":"2026-08-04T11:21:30.797160Z","title":"arXiv preprint arXiv:2601.12538 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:30.797160Z"},"links":{"cited_paper":"/paper/2601.12538","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:da13db55ccbee1f34cc1c3f57cf9d02cb8dcc1b3f79e90b148b4b33097cf964f","observation_id":"55881379-5aca-4698-bd96-58c9b832e468","resolution":{"observed_at":"2026-08-04T11:21:30.797160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-04T11:21:31.004277Z","title":"arXiv preprint arXiv:2505.15966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.004277Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:e853b330902b36f98ebaba5b2791c612ce23621da0241795274096c9f2abf07b","observation_id":"df3b4678-7401-46e3-91b6-83f0fe82961f","resolution":{"observed_at":"2026-08-04T11:21:31.004277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-04T11:21:31.166501Z","title":"thinking with images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.166501Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:40aa4a8f12a7771d426ca7339f0712df2eb2742373744df75482535fd900d508","observation_id":"f816da44-83dc-4692-88b4-b70cc062e96d","resolution":{"observed_at":"2026-08-04T11:21:31.166501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:31.296946Z","title":"arXiv preprint arXiv:2512.17306 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.296946Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:2276ed205a8f6d289009cb5b8340a8f3656439c6ae6610257596730d4537c0ef","observation_id":"49249fef-42c9-4c8a-b7c9-43c026bdfca5","resolution":{"observed_at":"2026-08-04T11:21:31.296946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-08-04T11:21:31.405672Z","title":"arXiv preprint arXiv:2508.11630 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.405672Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:bdb9e7b36d54f43aaddfc8ba96fa4077d9643368fee4b3b098b5aeae530636f9","observation_id":"89455cc3-5085-4285-a570-81fd2fb1678e","resolution":{"observed_at":"2026-08-04T11:21:31.405672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:31.526985Z","title":"arXiv preprint arXiv:2512.02361 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.526985Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:a6df718b8f78a3dd8df62d3a92ba493cfdcc2540cb79c122041bc78eff90d3cc","observation_id":"dd1ef5aa-348c-4636-8300-943e2d937d8e","resolution":{"observed_at":"2026-08-04T11:21:31.526985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-04T11:21:31.692492Z","title":"arXiv preprint arXiv:2511.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.692492Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:03e192ff051695fba3e38c041e27f02e62153e3592629c9f3a95468618fa3c5a","observation_id":"6cb20006-0d3a-48a5-a4f5-8efc69c24579","resolution":{"observed_at":"2026-08-04T11:21:31.692492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-04T11:21:31.750266Z","title":"arXiv preprint arXiv:2508.05748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.750266Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:fcb6bf221dabd2277ec66dab1f4cbb316fb5690d726291f5e2c9fa368fc87009","observation_id":"4f6d35e9-fb6f-426c-a75b-6bbbdf13e80f","resolution":{"observed_at":"2026-08-04T11:21:31.750266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-07T13:02:39.708613Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22525","snapshot_observed_at":"2026-08-04T11:21:31.872842Z","title":"arXiv preprint arXiv:2505.22525 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.872842Z"},"links":{"cited_paper":"/paper/2505.22525","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:b64bf489da390ce1c4f83959a205c428cb5892a01b41981c6e2e86470e89b193","observation_id":"d510e1af-4502-462d-be41-78f835eee30a","resolution":{"observed_at":"2026-08-04T11:21:31.872842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.099805Z","title":"arXiv preprint arXiv:2507.16746 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.099805Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:6b7ab5c24d537b2b668d424e7affc2eee6bfa414040fa1293c60f8564b26598f","observation_id":"2dadbcd5-be86-4b81-bf0d-e8418d1f040e","resolution":{"observed_at":"2026-08-04T11:21:32.099805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-08T15:29:25.221437Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16918","snapshot_observed_at":"2026-08-04T11:21:32.263785Z","title":"arXiv preprint arXiv:2512.16918 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.263785Z"},"links":{"cited_paper":"/paper/2512.16918","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:53136c471e3ce55dcdc181a60080492c306d4a00c93165f8581498594b991ae0","observation_id":"4db38c71-e37a-438c-a0e2-12554df5d705","resolution":{"observed_at":"2026-08-04T11:21:32.263785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.429232Z","title":"arXiv preprint arXiv:2601.18631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.429232Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:5ce864bae6609f4802c9ef792d8c852ee55900303fc25c298c3a1b69cd4a6b3d","observation_id":"206eba51-4c57-416c-95e3-eb2787142537","resolution":{"observed_at":"2026-08-04T11:21:32.429232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.570731Z","title":"arXiv preprint arXiv:2603.15030 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.570731Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:e5ad395e0d33362edf5b369892574708b1198b15e2eca1f1551284665062fc4a","observation_id":"dbbbd3cf-af88-4e92-80f9-7dbe7e046d10","resolution":{"observed_at":"2026-08-04T11:21:32.570731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.730680Z","title":"arXiv preprint arXiv:2511.01833 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.730680Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:f37ae4a26bedddcd7466e5e8b60fef916b4a625abd30d7a774ab166812180f29","observation_id":"86d17ebd-b77a-42c0-b0d4-4527b18a0376","resolution":{"observed_at":"2026-08-04T11:21:32.730680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.869736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.869736Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:a0a4036ad45396a4422a7b8c39b240698a27672f7b7c6ffc68bf2ac60b9c0198","observation_id":"50c8a02c-957f-4783-a411-b3c289753504","resolution":{"observed_at":"2026-08-04T11:21:32.869736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07998","last_updated":"2025-08-27T07:42:56Z","snapshot_observed_at":"2026-08-07T15:21:56.692035Z","submitted_at":"2025-07-10T17:59:55Z","title":"PyVision: Agentic Vision with Dynamic Tooling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07998","snapshot_observed_at":"2026-08-04T11:21:33.020557Z","title":"arXiv preprint arXiv:2507.07998 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.020557Z"},"links":{"cited_paper":"/paper/2507.07998","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:6657ac12f48d7011c9de9d53e39376d02f1fce41c1a1288b43bec13eed68ddc3","observation_id":"c0b2f9e1-cf90-44e3-8f8d-2e6eee964a40","resolution":{"observed_at":"2026-08-04T11:21:33.020557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.138152Z","title":"arXiv preprint arXiv:2512.18745 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.138152Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:48006f34055dbbaba908ddd3b0c3534f9e3502cc590c4df69fb7d2492c3fbd40","observation_id":"02aec7dc-2af6-4895-8104-92a6ef964c20","resolution":{"observed_at":"2026-08-04T11:21:33.138152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.307247Z","title":"Farrar, Straus and Giroux , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.307247Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:543c5a42ec20a7491b9b47f6d1876d679e732825600fc0c12ef5c9f83d01cb5b","observation_id":"c38a7f60-cf50-4fa5-a15c-c501dea87978","resolution":{"observed_at":"2026-08-04T11:21:33.307247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.419905Z","title":"arXiv preprint arXiv:2507.05255 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.419905Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:cd3130032ff93fe6faf72ff3185e24fb96ed29c3c46222149515965f8a9fd29c","observation_id":"3957ee38-fd3a-48a9-8f9d-f4a4f3e3cabe","resolution":{"observed_at":"2026-08-04T11:21:33.419905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.524745Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.524745Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:cf5a05f42ebe1f050fa1bd28c72990edd8ee93df70abf6ec56ce00a993f269a5","observation_id":"2915f643-f191-41e9-9ffd-12aaf5e2e5fb","resolution":{"observed_at":"2026-08-04T11:21:33.524745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.693985Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.693985Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:42d9481b811967de79b2c5bdedf902bbf9d7e8dd1b302133b9d4bec4a5596086","observation_id":"88b9b12c-e622-48a1-9057-12979cac378d","resolution":{"observed_at":"2026-08-04T11:21:33.693985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.865724Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.865724Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:ea20af3986c7911dbe8ed5a167863f4d9e6c1888e234f8dab34a4da804a5c226","observation_id":"3372be24-9f17-495b-b9ea-541be82e5469","resolution":{"observed_at":"2026-08-04T11:21:33.865724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T11:21:33.970631Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.970631Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:d9eb57345ee29165706831aa2ccfec23f430e80e51e09c17d7fb88b5e4d21cb2","observation_id":"49918bfa-7d57-4000-9ebc-11ca93b4ea3c","resolution":{"observed_at":"2026-08-04T11:21:33.970631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T11:21:34.081895Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.081895Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:b44d8b72c8be82e16cf57c534458b625fc27816ef8c66513ba898a51c9062d9c","observation_id":"5099f534-02a5-43ea-b00c-db6306f19bec","resolution":{"observed_at":"2026-08-04T11:21:34.081895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:34.283399Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.283399Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:2e52d2d51c44389d9b8a7cf1370a422891b7cdb60304f203624826b759a12c06","observation_id":"ae365339-1464-4dc8-b191-e42963bd7fbb","resolution":{"observed_at":"2026-08-04T11:21:34.283399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:34.360346Z","title":"arXiv preprint arXiv:2511.15718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.360346Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:a0701e0d61e46174acbded1ca88d0284610e7f576bcc3a3ceab802b3e4db50ca","observation_id":"87b44f03-1257-456f-9665-cbd4ab106994","resolution":{"observed_at":"2026-08-04T11:21:34.360346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-04T11:21:34.526276Z","title":"arXiv preprint arXiv:2504.11536 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.526276Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:16689ff5f67704f6d25e74b18eabbcff0d5d406013b3f3c685cb140b52ec0962","observation_id":"d513d2cf-386c-44d1-be56-dc834546aa97","resolution":{"observed_at":"2026-08-04T11:21:34.526276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-04T11:21:34.678773Z","title":"arXiv preprint arXiv:2602.15763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.678773Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:ca931e9bf7beedf724df32dcb521c59beda9b2eb592f5f2e75cc8e07f7b1bda3","observation_id":"40812ba8-8a59-44de-9aab-cf6eb63eaf52","resolution":{"observed_at":"2026-08-04T11:21:34.678773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:34.815993Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.815993Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:1567e9bd3cce31a6322c589c742260fd94c7a51793e9d75009cc6b580d07489a","observation_id":"2fbf0488-6a8b-4433-9c8d-8ce6e7e35811","resolution":{"observed_at":"2026-08-04T11:21:34.815993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-04T11:21:34.913476Z","title":"arXiv preprint arXiv:2210.03629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.913476Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:f299537629ccd71109abc24b3f202c6bf98ea2bc03b41822d96e36c891382f8b","observation_id":"b91c9aad-5e4f-4d65-94de-ec0c843f35f5","resolution":{"observed_at":"2026-08-04T11:21:34.913476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T11:21:35.051933Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.051933Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:69f0f3b0d2b0bfc43d2ed36f1f6253c49b552fe5c3ecbff9be9ea434559f732c","observation_id":"d0e61e84-7720-4e04-a005-4d514bccc29e","resolution":{"observed_at":"2026-08-04T11:21:35.051933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-04T11:21:35.222978Z","title":"arXiv preprint arXiv:2509.23661 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.222978Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:620ef49e14ac1d7c79505f719c8e3b036fb23c7f1002c5005a5cb56042e2bebf","observation_id":"d6a70588-d786-4d26-a807-748139f3f9aa","resolution":{"observed_at":"2026-08-04T11:21:35.222978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T11:21:35.368683Z","title":"arXiv preprint arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.368683Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:cccfc00ab63b20aac89f830811ded10f0611425686a7513fe4964d8ba1568441","observation_id":"dc1c3032-65e1-4bf6-9ac9-0d0528e9c944","resolution":{"observed_at":"2026-08-04T11:21:35.368683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T11:21:35.500219Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.500219Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:c1d4b9fa7ff7885b844769b593b0b02830bdc8bcd0c7a4b77f71b65f919f450f","observation_id":"c86a27b2-8213-4801-a597-4329d0ac8750","resolution":{"observed_at":"2026-08-04T11:21:35.500219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:35.631519Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.631519Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:b5287c895e4825918b3b6df9e959b2f2ac1839e45dd2690ed4763504eaf4b6e5","observation_id":"fa50ca38-c798-4265-bfb8-a211dd6f7b6c","resolution":{"observed_at":"2026-08-04T11:21:35.631519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:35.765804Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.765804Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:e0a78d8712aaa326d27280524040a8fbb894d76212239270a114bc45a6f3ce99","observation_id":"1a1e14f3-6f6e-46f4-8f4a-8a08cc0a7a15","resolution":{"observed_at":"2026-08-04T11:21:35.765804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:35.936455Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.936455Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:bf45e36a826252c1c31daf094baf58e2bbf6ae49f98adf53d132ce41d7d2f1aa","observation_id":"c01bcf76-1d62-497c-9306-353e3717f03d","resolution":{"observed_at":"2026-08-04T11:21:35.936455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.110916Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.110916Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:83adc4c4b156aaaad34533e64b7c54cbc77f1ac6b0ab203010c54d550a85ee15","observation_id":"315183c9-b652-4464-bbce-4d4eb4acdf37","resolution":{"observed_at":"2026-08-04T11:21:36.110916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.214560Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.214560Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:28044983287bfdc417c9569576cd15f8a3a808cc4e223d218733003f62fb8faf","observation_id":"dd8bc600-a797-42a8-a0f9-6fcb1c39a552","resolution":{"observed_at":"2026-08-04T11:21:36.214560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.359173Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.359173Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:bc0748638f9fd830be33da0e75db5183291ac0a81da3f6772858f58bb95948b7","observation_id":"ee49c02d-c949-4d28-9a0b-edd91c11fff7","resolution":{"observed_at":"2026-08-04T11:21:36.359173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.478619Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.478619Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:401bba879532d63d3662400c551927058abf7dc9235047decc6dd75b3f8443e5","observation_id":"946866a5-b25d-45ec-8549-25bfb2e1befd","resolution":{"observed_at":"2026-08-04T11:21:36.478619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.631982Z","title":"arXiv preprint arXiv:2512.17312 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.631982Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:c4ce380b9ed2ebd86ffbbfa0efa193d38f95c18dd93923b5ba544f61fb8b2ec1","observation_id":"420aea74-593e-41d7-bf4e-a5afd1214906","resolution":{"observed_at":"2026-08-04T11:21:36.631982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.13606","last_updated":"2026-04-29T05:49:25Z","snapshot_observed_at":"2026-07-06T22:42:12.887517Z","submitted_at":"2026-01-20T05:11:44Z","title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.13606","snapshot_observed_at":"2026-08-04T11:21:36.797757Z","title":"arXiv preprint arXiv:2601.13606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.797757Z"},"links":{"cited_paper":"/paper/2601.13606","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:164d4f6bee081a0cc01059aaaa85c5742766dd90a9b513a3a3cde17f8446dff1","observation_id":"5f43583c-36f5-46cf-b760-beeb723e8b31","resolution":{"observed_at":"2026-08-04T11:21:36.797757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-04T11:21:36.905665Z","title":"arXiv preprint arXiv:2509.07969 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.905665Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:2993d41fa663a11c4f2e3a3f192e38270ebb250342c6e18c96f1089221c5ffcc","observation_id":"406b1b09-af6c-4c3f-a08f-ce247c32f70b","resolution":{"observed_at":"2026-08-04T11:21:36.905665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T11:21:37.036845Z","title":"arXiv preprint arXiv:2504.10479 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.036845Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:0c6bdc5645b02ab3c77f116a596f9151865c477a55801f16cb739806a8ab6cb4","observation_id":"259f18f9-4c8f-4576-946c-8d20b5e8453c","resolution":{"observed_at":"2026-08-04T11:21:37.036845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T11:21:37.188863Z","title":"arXiv preprint arXiv:1711.05101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.188863Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:66323701c1ac79c78078e6fa7a074ea41427267f9d102a6de2d80d5b037c264d","observation_id":"cf64502c-aa57-495c-8bee-8c3a36aee59d","resolution":{"observed_at":"2026-08-04T11:21:37.188863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:37.299278Z","title":"arXiv preprint arXiv:2602.16742 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.299278Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:1ccb2de95ae9db0077d41d7a4c6b85ea9273d98308261a9458bdaa44c0237688","observation_id":"b6c457f4-93f2-45b4-a887-acde4635f9d6","resolution":{"observed_at":"2026-08-04T11:21:37.299278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:37.451142Z","title":"arXiv preprint arXiv:2511.21395 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.451142Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:9aebe94ecad394af8000c8a367662b11215fdf75427de0457bf20ecb64c6e019","observation_id":"8bed2fc4-6ddb-4e71-8487-d536773e9f46","resolution":{"observed_at":"2026-08-04T11:21:37.451142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:37.572703Z","title":"arXiv preprint arXiv:2511.19773 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.572703Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:fdcc286e03d818af86b0df5f88053a656f07152ac9da5067942900d268313f9a","observation_id":"37c1e6f3-32bd-43de-b202-1f24091eefa9","resolution":{"observed_at":"2026-08-04T11:21:37.572703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-04T11:21:37.751127Z","title":"arXiv preprint arXiv:2508.02324 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.751127Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:be690fae09c56da8ac30aeaf37d66975f45ec7b3808bd9b456afcf14fa3b79c3","observation_id":"2e3181e7-1cbd-441d-b30b-5b9ceea9a1d4","resolution":{"observed_at":"2026-08-04T11:21:37.751127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.02217."}