{"as_of":"2026-08-07T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8099fd5065d6214be3715047d6ab2c13cc7e311125054f31b226092a3cb5a67","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:28:52.191294Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T20:27:52.720629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:57.751321Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2508.10955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10955","snapshot_observed_at":"2026-07-03T20:18:57.751321Z","title":"arXiv preprint arXiv:2508.10955 , year=","venue":null,"work_id":"cf09414a-b893-4139-bd0f-04f2402950e3","year":2025},"citing_paper":{"arxiv_id":"2605.15077","last_updated":"2026-05-14T17:02:28Z","snapshot_observed_at":"2026-08-03T21:26:48.807000Z","submitted_at":"2026-05-14T17:02:28Z","title":"Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T20:27:52.720629Z"},"links":{"cited_paper":"/paper/2508.10955","citing_paper":"/paper/2605.15077"},"observation_digest":"sha256:c27e7aec7b5979b75ff02e196cb07c9a6d41c569b785834e55fb897152835d1b","observation_id":"66da2b2f-aac1-4605-85ed-e3100fe7ca98","resolution":{"observed_at":"2026-06-30T20:35:02.890082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2508.10955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10955","snapshot_observed_at":"2026-07-03T20:18:57.751321Z","title":"arXiv preprint arXiv:2508.10955 , year=","venue":null,"work_id":"cf09414a-b893-4139-bd0f-04f2402950e3","year":2025},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-04T07:49:41.211792Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2508.10955","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:c55f56088dceb0b199fd83bbfd61901dc1db9429c48e4a6235be0a890f63e35f","observation_id":"b8975de9-c192-4cd4-98ae-63ccf5f60752","resolution":{"observed_at":"2026-07-03T20:18:57.753169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10955/citation-record","integrity":"/paper/2508.10955/integrity","json":"/paper/2508.10955/citation-record.json","paper":"/paper/2508.10955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:41.469013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:41.469013Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:01bbd6424981c47ce6f2e3bdc009a2a4f0c48e959bf2151811536f78afd7c5bb","observation_id":"5f2fb718-29bb-4ec3-b487-21245ab8af04","resolution":{"observed_at":"2026-08-05T20:28:41.469013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T20:28:41.524917Z","title":"Achiam et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:41.524917Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c474f1996019595b7c4245bd1e23bfff0d9d0aebe874b79aaa8fa4a176e5ece1","observation_id":"2258ef16-bc16-47c9-ba82-903bf0a82c93","resolution":{"observed_at":"2026-08-05T20:28:41.524917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T20:28:41.622512Z","title":"Touvron et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:41.622512Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:9dfaa79be62ae80247594db6e8ecb9dcc7e616df7ed14c67e8be634d2e101701","observation_id":"d736a8e6-200f-4293-9f96-61dc05c7a929","resolution":{"observed_at":"2026-08-05T20:28:41.622512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:41.733277Z","title":"Chiang et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:41.733277Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:eb4cf38e9a432e03d7e1dc1d15f328eb956450a7915573299842e45e4a50ce6e","observation_id":"e05dd387-78df-4f23-ba43-747e51ab12b8","resolution":{"observed_at":"2026-08-05T20:28:41.733277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T20:28:41.859213Z","title":"Yang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:41.859213Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c1692249ffb5becbc828c0fb5027137a47a0130e4189f876adf9439da36a6648","observation_id":"23ede731-bf81-4393-9ade-35fb9f8f3dd3","resolution":{"observed_at":"2026-08-05T20:28:41.859213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T20:28:41.951733Z","title":"Liu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:41.951733Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:dea328db81db94dd67fb2819598b66fc84fc341667346155b7e02fa1afbddfed","observation_id":"a18470c7-4ca3-499e-99e2-cd8853044bab","resolution":{"observed_at":"2026-08-05T20:28:41.951733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:42.024919Z","title":"An et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.024919Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d6289b9048c37ce329147433a1e6ae28d310b5387a459d84f41804b0e0447488","observation_id":"cab4d624-26b1-4cbb-a585-7dee413ab139","resolution":{"observed_at":"2026-08-05T20:28:42.024919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:42.144398Z","title":"Kasneci et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.144398Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:8a2ac5bc3410b1bc3d5e33f9c036f32b097d63ff47e710aa3f6c1a5814e8edb4","observation_id":"d61101b5-8340-4d8d-aa84-089910337da4","resolution":{"observed_at":"2026-08-05T20:28:42.144398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15346","last_updated":"2024-07-22T03:05:32Z","snapshot_observed_at":"2026-07-06T18:49:51.231196Z","submitted_at":"2024-07-22T03:05:32Z","title":"Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15346","snapshot_observed_at":"2026-08-05T20:28:42.220021Z","title":"An et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.220021Z"},"links":{"cited_paper":"/paper/2407.15346","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4b6f1c7cd223163e063126ac8b1dacd7cb3011d989fbb8121a62e87a235b3197","observation_id":"64ebf1ea-761c-4911-b705-e61c630d1ac9","resolution":{"observed_at":"2026-08-05T20:28:42.220021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-05T20:28:42.331519Z","title":"Dai et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.331519Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5f87132c8d452cbf8ec84104d4a5b77ad0f7d53debeee3b64a1aee8e3d4e0c5a","observation_id":"07239a44-8713-4a3b-bcb2-c2b3efcf6a0a","resolution":{"observed_at":"2026-08-05T20:28:42.331519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T20:28:42.443220Z","title":"Liu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.443220Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:bf215c7f7b217e0e8c92f77004574810d2ac13d01d993cfe3bcee955648eba23","observation_id":"b473df2b-26fa-45c2-af03-c07c9c9342e8","resolution":{"observed_at":"2026-08-05T20:28:42.443220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T20:28:42.563682Z","title":"Zhu et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.563682Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:36e52b0370e2d4975e818e2738953339879d04ff57fa22fbddd25c81a1a0431b","observation_id":"1fdd6650-5428-4396-8f64-9fbeec244fe3","resolution":{"observed_at":"2026-08-05T20:28:42.563682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T20:28:42.618365Z","title":"Bai et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.618365Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:fa067ec5b9fd52093da1564876d0e98eea9f689545b829f063f38b7dbf2aea8f","observation_id":"b06de1ac-c9e3-4293-9dab-05b0b7c930af","resolution":{"observed_at":"2026-08-05T20:28:42.618365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-05T20:28:42.697303Z","title":"Wu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.697303Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:0ebddd4fd4de80381e9af57a8f615ab378676d160fd2a48ba420cebc91beac30","observation_id":"4962fb21-1c3a-41e3-b514-7ea6a905f0b7","resolution":{"observed_at":"2026-08-05T20:28:42.697303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:42.760493Z","title":"Yin et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.760493Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:6ab9dd4e1a02aec5851938e7a4a2c836cfb7135fa95a7ced481449ee12f5c0cc","observation_id":"c7a4a81f-d2b0-4048-b439-29b51b25a810","resolution":{"observed_at":"2026-08-05T20:28:42.760493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:42.847520Z","title":"Lin et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.847520Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:7c328ff69fdb01767bdf32d35df5e26cdf34a54906614f74b6e8fdcd419ea94e","observation_id":"34d56379-a8db-48d8-a329-5bc2da962a82","resolution":{"observed_at":"2026-08-05T20:28:42.847520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-05T20:28:42.950551Z","title":"Bai et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.950551Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:73700008f15ff54f00539c08a6077389f410f410b7a3dd29af1c7ebaad28ab14","observation_id":"a9665dd2-907f-4382-b649-b6ff4213d51a","resolution":{"observed_at":"2026-08-05T20:28:42.950551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:43.042012Z","title":"Zhang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.042012Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c4b3e7ed9645f80772c23337239a4f9c86a084889c4aa8147da0f313efd31487","observation_id":"22d35c98-0622-4d60-bdf2-b5789a6d4b28","resolution":{"observed_at":"2026-08-05T20:28:43.042012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14056","last_updated":"2024-12-18T17:06:21Z","snapshot_observed_at":"2026-07-06T20:09:24.415233Z","submitted_at":"2024-12-18T17:06:21Z","title":"A Review of Multimodal Explainable Artificial Intelligence: Past, Present and Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14056","snapshot_observed_at":"2026-08-05T20:28:43.121644Z","title":"Sun et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.121644Z"},"links":{"cited_paper":"/paper/2412.14056","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:8fae6b42d4ae3fa62c5a8b47cbc8f198f362ce073f38cda54b72e5ebd23a5cd3","observation_id":"12856245-0a20-44c8-8ffa-7049acf5904e","resolution":{"observed_at":"2026-08-05T20:28:43.121644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-05T20:28:43.224757Z","title":"Wang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.224757Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d75ee9dac19d1dbdc4abd72f469b2cb79858d30d2b3f2f0059bfe84b73f4d357","observation_id":"d3aa965b-2c8f-4d9d-8d30-5ca10b9abcad","resolution":{"observed_at":"2026-08-05T20:28:43.224757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04920","last_updated":"2023-04-11T01:17:11Z","snapshot_observed_at":"2026-07-06T15:14:13.670044Z","submitted_at":"2023-04-11T01:17:11Z","title":"Advancing Medical Imaging with Language Models: A Journey from N-grams to ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04920","snapshot_observed_at":"2026-08-05T20:28:43.326276Z","title":"Hu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.326276Z"},"links":{"cited_paper":"/paper/2304.04920","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:f6dde7c464c28242b295ad867636c8fd29cededba945710dda795b42eb9d9500","observation_id":"fd7a79f2-1d69-4e3e-964b-b976d4b4fd4d","resolution":{"observed_at":"2026-08-05T20:28:43.326276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01957","last_updated":"2023-10-13T21:59:27Z","snapshot_observed_at":"2026-07-06T16:27:02.440383Z","submitted_at":"2023-10-03T11:05:14Z","title":"Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01957","snapshot_observed_at":"2026-08-05T20:28:43.426121Z","title":"Chen et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.426121Z"},"links":{"cited_paper":"/paper/2310.01957","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:414f869213ef49bfb043d40035521af7077e9e9db548dd06ac0adfff8e252bbb","observation_id":"2c97d7f4-7208-4a69-bd79-d5e52ea82be5","resolution":{"observed_at":"2026-08-05T20:28:43.426121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T20:28:43.492381Z","title":"Hurst et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.492381Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c308f66d184dfbe7160ed90750c6be825f764b423addc389fd02890efeb66f54","observation_id":"c769756a-00d4-4e3d-b21b-eeb99253c3fa","resolution":{"observed_at":"2026-08-05T20:28:43.492381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:43.533627Z","title":"Radford et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.533627Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c99c966c091e13079947f1b56ef5db705a93a3fbde9543c17a48a874259d7cf8","observation_id":"2cf41a9d-2598-469b-9396-77c7ece97dca","resolution":{"observed_at":"2026-08-05T20:28:43.533627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:43.606912Z","title":"Liu et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.606912Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:b3266cf9860006800ef7ef4a185c1c99100cbbac20a50c4bd420643eee7feaea","observation_id":"3485b36e-c28b-45d9-8a9d-807f7c7776ac","resolution":{"observed_at":"2026-08-05T20:28:43.606912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:43.727323Z","title":"Elizalde et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.727323Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:a799657586ec8e2161065c742faea19fa62c7765ef077f6fdaa5aec97856e18c","observation_id":"02a08343-6cf2-43bf-89e7-97f13a1bbb51","resolution":{"observed_at":"2026-08-05T20:28:43.727323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-05T20:28:43.838854Z","title":"Lauren c on et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.838854Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d6b47a0e56222f2ca638cf0d9a8e3613395b460d96bc884a4d976330551dd72b","observation_id":"64e5f3c9-5f95-4f88-965a-c6183ce17177","resolution":{"observed_at":"2026-08-05T20:28:43.838854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T20:28:43.983832Z","title":"Bai et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:43.983832Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:412a6e4926c2b0433f50e035d002607adb43ddf99ea00f25a42a9463e29db3e2","observation_id":"a4e7c2ad-81d5-4c42-b8bf-7c5703b7ca60","resolution":{"observed_at":"2026-08-05T20:28:43.983832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:44.124510Z","title":"Qin et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:44.124510Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:19f05535ced3ef0fb950def6b31e195b8119f05d52003ccc28373cd5c87bf144","observation_id":"afead839-0fb5-4305-9154-7fc022883982","resolution":{"observed_at":"2026-08-05T20:28:44.124510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T20:28:44.315363Z","title":"Team et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:44.315363Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:9c1de4bdf83566fae4bde80de2f79bf9fa2b62c004bd19793df243068760ed6b","observation_id":"57aad9ac-02b3-43f9-add2-5a200a07c74d","resolution":{"observed_at":"2026-08-05T20:28:44.315363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14683","last_updated":"2024-06-16T18:43:50Z","snapshot_observed_at":"2026-07-06T17:34:03.539565Z","submitted_at":"2024-02-22T16:40:33Z","title":"Visual Hallucinations of Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14683","snapshot_observed_at":"2026-08-05T20:28:44.432144Z","title":"Huang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:44.432144Z"},"links":{"cited_paper":"/paper/2402.14683","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:0ff2ecf4ae586ba1b325d2bc641ea8650ef4120c2afd73002282089105600117","observation_id":"22d363ff-ec68-4982-b136-9c4ba7dffbba","resolution":{"observed_at":"2026-08-05T20:28:44.432144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03757","last_updated":"2024-10-03T03:40:20Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T06:48:46Z","title":"The Instinctive Bias: Spurious Images lead to Illusion in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03757","snapshot_observed_at":"2026-08-05T20:28:44.587330Z","title":"Han et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:44.587330Z"},"links":{"cited_paper":"/paper/2402.03757","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:142c807cdedc88c4985ed484468713f62878b6befa6971a4fdc5632243a41485","observation_id":"c12a7cc3-1498-4452-9ffc-fa7f5886e854","resolution":{"observed_at":"2026-08-05T20:28:44.587330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:44.741597Z","title":"Tong et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:44.741597Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4d5e8fa68a4976aca30034af99b8140eab1167bacd6409f2452a51d09f5b7717","observation_id":"9d40d457-af28-43b3-be63-4463d4b14ac5","resolution":{"observed_at":"2026-08-05T20:28:44.741597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:44.881114Z","title":"Sharma et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:44.881114Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:b23b33e2ef345aaecc87359b80d03f6c17029f1ae3abe8f9f762cfe0700ffae2","observation_id":"318cb45d-effe-41c7-b7e0-09a9ce057d9f","resolution":{"observed_at":"2026-08-05T20:28:44.881114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:45.069393Z","title":"Chambers et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:45.069393Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:26872a866a6dbd1768303d2356b8138bb86042bc6e559fe57177b0eb6fe739f8","observation_id":"b3bbfc0d-aab2-4e88-b0ab-1ef73dd05fb4","resolution":{"observed_at":"2026-08-05T20:28:45.069393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-05T20:28:45.232824Z","title":"Chen et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:45.232824Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c15abc9bb16fb8346390b3d170ed840b0f35dc80479e2a135e371baf7dee9ced","observation_id":"4cb69058-bd2c-462f-ae8f-ff6dbf3a4435","resolution":{"observed_at":"2026-08-05T20:28:45.232824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:45.432745Z","title":"Schuhmann et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:45.432745Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:0bc857094753e3b8ab75d18d0abb39c0c0625a4f83fa719bb5d743993d373652","observation_id":"3b0f3e3a-84a1-428e-ac05-6cf7511bc3f0","resolution":{"observed_at":"2026-08-05T20:28:45.432745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:45.563613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:45.563613Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:989341a6103bae4811795a837cb5a4105c3318e43daeff74e6333edbbbcf0530","observation_id":"9d71db80-9ebd-4a82-b353-7d4a0bfa00dc","resolution":{"observed_at":"2026-08-05T20:28:45.563613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:45.781618Z","title":"Jia et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:45.781618Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:9a5976db18ff32b9195d4d7031eeb34a86b0208300b621807c5f5d43e7f37e92","observation_id":"2b99854b-a477-4bb7-bd01-21913631e7b5","resolution":{"observed_at":"2026-08-05T20:28:45.781618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:45.913294Z","title":"Zhu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:45.913294Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:8fe65cd1a116e44ba8b599ace60f7014e8b73c823e2857affe0391af1af9f0c7","observation_id":"e71ed163-06ac-4b63-8c53-65a3a1e9aa55","resolution":{"observed_at":"2026-08-05T20:28:45.913294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:46.009183Z","title":"Gu et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.009183Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5063d1bc34d8ff2fad86c10c51722e1065228afa51eb0da3681c0d1874ab60d8","observation_id":"e0668e98-25d4-47a8-8736-4fde5a611fd5","resolution":{"observed_at":"2026-08-05T20:28:46.009183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:46.142635Z","title":"Srinivasan et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.142635Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d5df2898d6afb67d48051b92e0d8d7141ad108a763549ef60b0ebb055f838fca","observation_id":"2a252014-c327-4978-a936-d376047e8ef3","resolution":{"observed_at":"2026-08-05T20:28:46.142635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:46.271710Z","title":"Changpinyo et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.271710Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:288d0d99df3c0f05d4d2754afdb3a0c031aeb3f864aae54bdc7512965c4b3ea3","observation_id":"283d106f-4e62-45b8-97bb-031c1ddea906","resolution":{"observed_at":"2026-08-05T20:28:46.271710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11431","last_updated":"2021-11-22T18:59:34Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:34Z","title":"RedCaps: web-curated image-text data created by the people, for the people","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11431","snapshot_observed_at":"2026-08-05T20:28:46.376809Z","title":"Desai et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.376809Z"},"links":{"cited_paper":"/paper/2111.11431","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:51d32b17092b373cd400f35250f934e8c9c3d5966cbfd272300f176dcc9d9e64","observation_id":"147de0dc-a5af-442c-8652-8b7cca3e7869","resolution":{"observed_at":"2026-08-05T20:28:46.376809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-08-05T20:28:46.452098Z","title":"Li et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.452098Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:f59a12f50977a3a2bbd4d4fd100fc531e953695ee2c36977587e5d7a74625e30","observation_id":"7da3b7e4-3912-42b7-8476-7b73c77741b9","resolution":{"observed_at":"2026-08-05T20:28:46.452098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:46.559439Z","title":"Goyal et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.559439Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4dfea7fa2f9cf9091131418ca0da846d7c8098dbe7666d3b9af9bbaf3ca277b9","observation_id":"9df81e88-3a55-4182-ba61-e09d4f32fdda","resolution":{"observed_at":"2026-08-05T20:28:46.559439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06475","last_updated":"2017-11-17T09:58:20Z","snapshot_observed_at":"2026-07-06T06:09:59.838086Z","submitted_at":"2017-11-17T09:58:20Z","title":"AI Challenger : A Large-scale Dataset for Going Deeper in Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06475","snapshot_observed_at":"2026-08-05T20:28:46.686307Z","title":"Wu et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.686307Z"},"links":{"cited_paper":"/paper/1711.06475","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:41fcd5f2439446120acfa9000685c09f119117358b32f25f526b39e306bc518a","observation_id":"51043a50-dae6-44d3-88ac-8b139f157df7","resolution":{"observed_at":"2026-08-05T20:28:46.686307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:46.810039Z","title":"Ordonez et al","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.810039Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:ccfae68b6ce8ba044a4efbb8d8a352449b45f5cec178e8947bf10be28a303813","observation_id":"fbd3b915-91b4-4521-bd45-70973a5ae995","resolution":{"observed_at":"2026-08-05T20:28:46.810039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09962","last_updated":"2024-10-15T16:10:26Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T18:59:58Z","title":"LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09962","snapshot_observed_at":"2026-08-05T20:28:46.884757Z","title":"Qiu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:46.884757Z"},"links":{"cited_paper":"/paper/2410.09962","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:82453fcf520e0d3e294a6278d33f85236b0a1146ac6b9dcadb1d1e181add272b","observation_id":"e6bc4879-1119-44c8-a419-931966662dcb","resolution":{"observed_at":"2026-08-05T20:28:46.884757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10900","last_updated":"2024-10-09T03:42:22Z","snapshot_observed_at":"2026-08-04T12:00:18.042012Z","submitted_at":"2024-06-16T11:44:43Z","title":"AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10900","snapshot_observed_at":"2026-08-05T20:28:47.015807Z","title":"Wu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.015807Z"},"links":{"cited_paper":"/paper/2406.10900","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:48c5eb12e81aee8bf7bb1094d0fbc89e4c267d0f7c030cc8d6e52cc383b9a4dc","observation_id":"ba96c738-9179-45e6-aab5-624306115f80","resolution":{"observed_at":"2026-08-05T20:28:47.015807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:47.128579Z","title":"Kaul et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.128579Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:0a7da50c888f0ad70573b78291617ad1857cba3e33de3bb4da69659af3f7fe89","observation_id":"b35ac00b-b915-4d25-bdd9-1b6bcf41f0d4","resolution":{"observed_at":"2026-08-05T20:28:47.128579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11116","last_updated":"2025-04-14T12:11:51Z","snapshot_observed_at":"2026-08-03T16:32:32.602866Z","submitted_at":"2024-03-17T06:53:44Z","title":"PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11116","snapshot_observed_at":"2026-08-05T20:28:47.282413Z","title":"Liu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.282413Z"},"links":{"cited_paper":"/paper/2403.11116","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d4036386beb3910ba89347d5497b8f172d259064559998c12f244255470249b1","observation_id":"0bf22715-974b-4794-8525-c081ffe87aa6","resolution":{"observed_at":"2026-08-05T20:28:47.282413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:47.442410Z","title":"Gao et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.442410Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:7025e629b66341b9c14e906b9b3393e4e10f81dcb5c48adcc56d910f154ae3d1","observation_id":"f4f25f46-fc6d-4fa4-9a9d-e03bd9b1fa22","resolution":{"observed_at":"2026-08-05T20:28:47.442410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13220","last_updated":"2024-07-23T07:02:30Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:31:27Z","title":"How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13220","snapshot_observed_at":"2026-08-05T20:28:47.627486Z","title":"Qian et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.627486Z"},"links":{"cited_paper":"/paper/2402.13220","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:8c381ac7367e5e9273ccdff5ac9cbe7e72a213a4811415b7547a2cdad7298306","observation_id":"cd753afd-ec0b-4db6-ad30-ce52cf740ecd","resolution":{"observed_at":"2026-08-05T20:28:47.627486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03631","last_updated":"2024-10-16T19:35:55Z","snapshot_observed_at":"2026-07-06T16:57:51.263433Z","submitted_at":"2023-12-06T17:28:03Z","title":"Mitigating Open-Vocabulary Caption Hallucinations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03631","snapshot_observed_at":"2026-08-05T20:28:47.779619Z","title":"Ben-Kish et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.779619Z"},"links":{"cited_paper":"/paper/2312.03631","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:2894a97260c53aef35034d54a14e0190cfc1131b67a23eed28c78316a63dd633","observation_id":"c6e8bad8-9633-477a-ad0b-7a306ceedcf0","resolution":{"observed_at":"2026-08-05T20:28:47.779619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:47.865301Z","title":"Wang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.865301Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5405721fcc1a54bf4c21e3710b830a525cc39d7ef9aaaa910ce40d9fe78f51b1","observation_id":"23e1a9fc-e9b4-4f96-bf7a-2ba4b7e66968","resolution":{"observed_at":"2026-08-05T20:28:47.865301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05338","last_updated":"2024-08-13T05:48:31Z","snapshot_observed_at":"2026-07-06T16:29:32.059905Z","submitted_at":"2023-10-09T01:52:27Z","title":"Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05338","snapshot_observed_at":"2026-08-05T20:28:47.982948Z","title":"Lovenia et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:47.982948Z"},"links":{"cited_paper":"/paper/2310.05338","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:902566566a28f7a83d39ed8c41346936193028a15c394bd824d4dd69a6e77ec2","observation_id":"98871d96-177c-4b34-85fe-4b2b3af39ab6","resolution":{"observed_at":"2026-08-05T20:28:47.982948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-05T20:28:48.136224Z","title":"Liu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.136224Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:66da3395016cc7973a3aabd4d985271d05bf0fc71499e6e3270b95b6af4fb3d6","observation_id":"f7ecc5b3-94a7-4931-a6f4-af7df11838e5","resolution":{"observed_at":"2026-08-05T20:28:48.136224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02301","last_updated":"2023-11-24T07:07:03Z","snapshot_observed_at":"2026-08-03T03:23:08.919296Z","submitted_at":"2023-09-05T15:06:37Z","title":"CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02301","snapshot_observed_at":"2026-08-05T20:28:48.314931Z","title":"Hu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.314931Z"},"links":{"cited_paper":"/paper/2309.02301","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:00f1ca86d664390a60f2fde75efd80d9972e3d3c519172830cdd1eb31815c296","observation_id":"acd2758d-9be4-4bea-959a-d49958327050","resolution":{"observed_at":"2026-08-05T20:28:48.314931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00569","last_updated":"2024-08-03T17:52:43Z","snapshot_observed_at":"2026-08-05T17:18:35.898227Z","submitted_at":"2024-06-30T03:04:11Z","title":"Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00569","snapshot_observed_at":"2026-08-05T20:28:48.416727Z","title":"Zhong et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.416727Z"},"links":{"cited_paper":"/paper/2407.00569","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d2ecd3554a84699be6bb349cbb4e16693f6869cdb2c866bdd2bc0c533de9a19a","observation_id":"8008bae5-a180-48ea-aea7-188653c24258","resolution":{"observed_at":"2026-08-05T20:28:48.416727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T20:28:48.508649Z","title":"Li et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.508649Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4b818618990a8b5ee825c7e9bb8cee612105d6197b3e8c65cbc256ef0ad07c23","observation_id":"da879e89-1fa4-4893-b6cd-b2135a2a2a45","resolution":{"observed_at":"2026-08-05T20:28:48.508649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:48.623443Z","title":"Kafle et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.623443Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:9c96efcff1c945fdfa74e7295abb3a7f4a5904c9441cc40b50c6e1850f928fc5","observation_id":"24ee279a-d617-4c2e-8ef1-207577892b19","resolution":{"observed_at":"2026-08-05T20:28:48.623443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:48.714821Z","title":"Nie et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.714821Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:7aca7005929f08b7a98f7baa5d57d2b760699b85b9db1f530c24bad17f6b61d7","observation_id":"0ea56995-7318-4e76-8dfe-129bd3d1cb6e","resolution":{"observed_at":"2026-08-05T20:28:48.714821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03176","last_updated":"2024-10-04T06:24:49Z","snapshot_observed_at":"2026-08-06T02:20:11.200507Z","submitted_at":"2024-10-04T06:24:49Z","title":"Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03176","snapshot_observed_at":"2026-08-05T20:28:48.783895Z","title":"Liu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.783895Z"},"links":{"cited_paper":"/paper/2410.03176","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5edcb42ad8ed9917f113f57c76b8493f6d3ea53d4cd0e61b83c175fa9ae18b85","observation_id":"aca49152-8d3b-419e-b935-04d214d8905d","resolution":{"observed_at":"2026-08-05T20:28:48.783895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:48.890772Z","title":"Ziyang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.890772Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:df809b575755346c6d80cc5640cde38f88ffe0e3eadaebcfd19235a42a4b1197","observation_id":"770d11c5-79f1-426e-bb62-9151f70f6809","resolution":{"observed_at":"2026-08-05T20:28:48.890772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02904","last_updated":"2024-04-03T17:59:36Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:36Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02904","snapshot_observed_at":"2026-08-05T20:28:48.983205Z","title":"Petryk et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.983205Z"},"links":{"cited_paper":"/paper/2404.02904","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5ceb4fb95e6ac2195a1e14a96c275bef0e493192ca043a628c456397cb767f50","observation_id":"088d517e-e909-44ef-895b-f1ffda52cd07","resolution":{"observed_at":"2026-08-05T20:28:48.983205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:49.059448Z","title":"Jiang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.059448Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:ebd3450e3c4617dd7ba1cba8d9f474e9a59fbee2bbaa6402457ed2bcc057c236","observation_id":"913e0e28-253a-4fda-b448-05d31844867b","resolution":{"observed_at":"2026-08-05T20:28:49.059448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03190","last_updated":"2024-05-27T11:52:56Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T16:56:11Z","title":"Unified Hallucination Detection for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03190","snapshot_observed_at":"2026-08-05T20:28:49.194785Z","title":"Chen et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.194785Z"},"links":{"cited_paper":"/paper/2402.03190","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:b45688794f9af7855a749aceb00cc14a77292424711d9743fea110665152fb35","observation_id":"14cf1ee1-3e11-41fa-a9f3-b8b7142b50d3","resolution":{"observed_at":"2026-08-05T20:28:49.194785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:49.259291Z","title":"Villa et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.259291Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:2d8985d7f2bd052d5b70632d24470dd98271989c88290c4acafd3b4244a6369c","observation_id":"c1b8dbde-b7c6-45be-b805-c4e16b767442","resolution":{"observed_at":"2026-08-05T20:28:49.259291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16479","last_updated":"2023-11-27T09:30:02Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-27T09:30:02Z","title":"Mitigating Hallucination in Visual Language Models with Visual Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16479","snapshot_observed_at":"2026-08-05T20:28:49.334319Z","title":"Chen et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.334319Z"},"links":{"cited_paper":"/paper/2311.16479","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5aa8b92f59751bf8023403b2fd5dd71bf322daa992ee54fe4dd2419eb335b7dd","observation_id":"47ddd280-18d3-4e45-805d-1302506791bd","resolution":{"observed_at":"2026-08-05T20:28:49.334319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01779","last_updated":"2024-03-28T22:27:12Z","snapshot_observed_at":"2026-07-06T16:26:54.244094Z","submitted_at":"2023-10-03T04:01:27Z","title":"HallE-Control: Controlling Object Hallucination in Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01779","snapshot_observed_at":"2026-08-05T20:28:49.437336Z","title":"Zhai et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.437336Z"},"links":{"cited_paper":"/paper/2310.01779","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:a04910297f49e1686ea0c38b28af8c8bedd4c5aed2914842d24f05740fc69b16","observation_id":"2b871298-39fa-489e-bb07-c819cefd682e","resolution":{"observed_at":"2026-08-05T20:28:49.437336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15126","last_updated":"2023-10-10T11:57:26Z","snapshot_observed_at":"2026-08-01T17:12:16.290540Z","submitted_at":"2023-08-29T08:51:24Z","title":"Evaluation and Analysis of Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15126","snapshot_observed_at":"2026-08-05T20:28:49.541282Z","title":"Wang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.541282Z"},"links":{"cited_paper":"/paper/2308.15126","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:3dd53063298bf4e1571e0389254abaad85acfa583c76c6f93077cbc2529bc584","observation_id":"81dd63a9-3c10-496d-8a39-9ecb23b1185a","resolution":{"observed_at":"2026-08-05T20:28:49.541282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-05T20:28:49.638187Z","title":"Li et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.638187Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5de67c1d44cdf473e29b58553fd0a7607031fde067de6256be9bbce749e51f3c","observation_id":"26eec382-7c9a-4d06-a3bf-535d40461e6e","resolution":{"observed_at":"2026-08-05T20:28:49.638187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16375","last_updated":"2025-01-20T00:29:19Z","snapshot_observed_at":"2026-08-06T04:34:36.950710Z","submitted_at":"2024-04-25T07:29:17Z","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16375","snapshot_observed_at":"2026-08-05T20:28:49.694202Z","title":"Yan et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.694202Z"},"links":{"cited_paper":"/paper/2404.16375","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:0088d8b2027d746dfdd0f476272cfae3e4a4bfd977a2e6b785147e1bd818b391","observation_id":"bcf651fa-8d24-4cab-a038-bd692a4e5221","resolution":{"observed_at":"2026-08-05T20:28:49.694202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:49.826237Z","title":"Gunjal et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.826237Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:7058e4229190a5c9205d24bf16a7889e10cf1ab1ddf68177af3b7f7e150ab82c","observation_id":"10f44f90-3439-48c5-a627-fdb6bc2b3b8a","resolution":{"observed_at":"2026-08-05T20:28:49.826237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20622","last_updated":"2025-03-13T23:10:24Z","snapshot_observed_at":"2026-07-06T20:14:27.082070Z","submitted_at":"2024-12-29T23:56:01Z","title":"Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20622","snapshot_observed_at":"2026-08-05T20:28:49.900662Z","title":"Seth et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.900662Z"},"links":{"cited_paper":"/paper/2412.20622","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d9ccea2acfe243cdd9465bb487df5498717f37d899938cf10b93f67b1f8e6181","observation_id":"6a4e3b08-9a8d-47ce-ad5c-02988886fb15","resolution":{"observed_at":"2026-08-05T20:28:49.900662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-06T20:31:18.439488Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-05T20:28:49.973347Z","title":"Wang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:49.973347Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:cbe508af34dc83d3c3e27951220490da55d004af0866aa8f9a0d3065bcd33174","observation_id":"67395221-9853-4575-b4c2-3f03ae334068","resolution":{"observed_at":"2026-08-05T20:28:49.973347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15952","last_updated":"2024-08-09T14:26:02Z","snapshot_observed_at":"2026-07-06T17:49:36.858294Z","submitted_at":"2024-03-23T23:06:32Z","title":"IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15952","snapshot_observed_at":"2026-08-05T20:28:50.070895Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.070895Z"},"links":{"cited_paper":"/paper/2403.15952","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:7843f851eeae0af1c7110ce590c21bbe13bdc315c5000c23ab749887e39e711f","observation_id":"4e7533f3-45be-49f4-8ab8-417bdd1a5967","resolution":{"observed_at":"2026-08-05T20:28:50.070895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15683","last_updated":"2025-03-06T03:59:59Z","snapshot_observed_at":"2026-08-04T04:09:59.723541Z","submitted_at":"2024-05-24T16:21:59Z","title":"Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15683","snapshot_observed_at":"2026-08-05T20:28:50.178489Z","title":"Ghosh et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.178489Z"},"links":{"cited_paper":"/paper/2405.15683","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:e79f509eb16a0d0915cfd6642aa3db03537c7708a4a7cb6c44e85a4eeb738f86","observation_id":"cdde58e5-e4a9-4195-b617-8df115b4e787","resolution":{"observed_at":"2026-08-05T20:28:50.178489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:50.335758Z","title":"Li et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.335758Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:2bf4bb0081031a59086ab750d58f2afd410097367f20f2de97e54fdd49d29d52","observation_id":"8f36471a-4472-4aa5-ad8c-c338ceb54975","resolution":{"observed_at":"2026-08-05T20:28:50.335758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:50.471161Z","title":"Byeon et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.471161Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c273a98daec6abb4731c8f24899c56e2913039bd51e76bd0f6b5372a2b5b4d9a","observation_id":"adcd05e1-380d-4541-98a8-311c49b126b6","resolution":{"observed_at":"2026-08-05T20:28:50.471161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:50.566935Z","title":"Lauren c on et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.566935Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:72daaa52098ce5a9f14435059dfb8e61e03ba01ea3de74528e883ab09a87c7bd","observation_id":"840da11f-dd03-4f2c-a372-f4f35cca9a3e","resolution":{"observed_at":"2026-08-05T20:28:50.566935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T20:28:50.643441Z","title":"Oquab et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.643441Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4f6cf0fa5ec8fd72e8736aa318ee6e62306fe59eea91ddabec99cbfbde7083c7","observation_id":"40c2c92c-2c1b-4cfb-93a9-05f9952b7e04","resolution":{"observed_at":"2026-08-05T20:28:50.643441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-05T20:28:50.768814Z","title":"Podell et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.768814Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:e177ddd81fa902ce88d95b980b91877c926ddf46f07d997f44b7e8d9d0695992","observation_id":"9d137212-55cc-45c6-9f4a-ddb0a7fbece3","resolution":{"observed_at":"2026-08-05T20:28:50.768814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:50.899877Z","title":"Betker et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:50.899877Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:a6149a95ec66f5d674202b7fd58629cafe227441838d3f98557567dd7be8341e","observation_id":"05d19ee4-74cf-440e-9db5-892c5d424c3e","resolution":{"observed_at":"2026-08-05T20:28:50.899877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:51.006079Z","title":"Zou et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.006079Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4aafc57584a7cb2d4e60c4af7efb29b93e3fd81421ea9d677229fdcc1d118ac6","observation_id":"0b5a4440-8300-4fe0-b41c-010f3c933b20","resolution":{"observed_at":"2026-08-05T20:28:51.006079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:51.106784Z","title":"Liu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.106784Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c870386b6ffeed0d0b3d07e2c792101cbb52e1c1f94c722e38f24bfab1a3ae8f","observation_id":"93f97d2d-4b46-4897-8b7f-6629373d4f03","resolution":{"observed_at":"2026-08-05T20:28:51.106784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15200","last_updated":"2023-11-16T07:11:02Z","snapshot_observed_at":"2026-07-06T16:37:23.707569Z","submitted_at":"2023-10-23T08:13:33Z","title":"Open-Set Image Tagging with Multi-Grained Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15200","snapshot_observed_at":"2026-08-05T20:28:51.187504Z","title":"Huang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.187504Z"},"links":{"cited_paper":"/paper/2310.15200","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:89e25840dac009f5d60403fee1f89e1e5ea5c7eb961b6a4d566cc62f48212f9e","observation_id":"b40bbb30-3b13-4ef7-8848-2f6f9b4f1bcb","resolution":{"observed_at":"2026-08-05T20:28:51.187504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:51.297123Z","title":"Li et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.297123Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:7f164137b1997e9d609757ac30d1ed2ad6c107563a8120c1d0ed09b733a71f92","observation_id":"4e4c4c8c-4eb8-428b-80ff-01afa466fc88","resolution":{"observed_at":"2026-08-05T20:28:51.297123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-05T20:28:51.375646Z","title":"Zhang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.375646Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:eec827c004c229a2eef917bee59fb0344b0e4b377871dd8967c8eab16d456b9a","observation_id":"2cf69c53-d2e1-44e5-80f6-76e4799599e8","resolution":{"observed_at":"2026-08-05T20:28:51.375646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09118","last_updated":"2022-08-29T12:17:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-16T18:57:37Z","title":"Unsupervised Dense Information Retrieval with Contrastive Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09118","snapshot_observed_at":"2026-08-05T20:28:51.467961Z","title":"Izacard et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.467961Z"},"links":{"cited_paper":"/paper/2112.09118","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:caceafce4e6c73c7e6d1ad780f5c94f044e036eb469052399f843dbfbbb3140a","observation_id":"767ec9f3-ae42-44a9-aeab-83b655885d65","resolution":{"observed_at":"2026-08-05T20:28:51.467961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:51.557669Z","title":"Saito et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.557669Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c85ca1661bea6c13915ada788355f10bfe6b6c790f72ecde073d17a390c29edd","observation_id":"b431ca53-5024-465e-9b2d-c736f5dc472f","resolution":{"observed_at":"2026-08-05T20:28:51.557669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03776","last_updated":"2024-06-07T05:58:45Z","snapshot_observed_at":"2026-08-07T07:26:52.316700Z","submitted_at":"2024-06-06T06:40:19Z","title":"XL-HeadTags: Leveraging Multimodal Retrieval Augmentation for the Multilingual Generation of News Headlines and Tags","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03776","snapshot_observed_at":"2026-08-05T20:28:51.655385Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.655385Z"},"links":{"cited_paper":"/paper/2406.03776","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c168340074795ed5a1ad7af68701ff92bbf7d1a971abfe6f3e141cee6f642216","observation_id":"be3ee836-3f7e-4fd2-971d-d00cfd9c9411","resolution":{"observed_at":"2026-08-05T20:28:51.655385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12735","last_updated":"2024-12-02T02:34:47Z","snapshot_observed_at":"2026-08-05T16:52:46.144105Z","submitted_at":"2024-07-17T16:55:42Z","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12735","snapshot_observed_at":"2026-08-05T20:28:51.739526Z","title":"Yan and W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.739526Z"},"links":{"cited_paper":"/paper/2407.12735","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:7d27989042dc0693e3e8d32f8e52c7ae79f26b0484501f1feb3158f11ef76e7f","observation_id":"f7871e68-32ff-4d91-81aa-d9d2307a3a28","resolution":{"observed_at":"2026-08-05T20:28:51.739526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:51.800324Z","title":"Kumar and P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.800324Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c23fd3e74cbc24844f76deaf076a3c9f3bcd6fc9b05a995fe91dda77a1e0ce98","observation_id":"4b149840-36e3-4d13-b735-cfdd2c01c29f","resolution":{"observed_at":"2026-08-05T20:28:51.800324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14457","last_updated":"2024-12-19T02:17:35Z","snapshot_observed_at":"2026-08-02T19:27:49.938558Z","submitted_at":"2024-12-19T02:17:35Z","title":"VISA: Retrieval Augmented Generation with Visual Source Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14457","snapshot_observed_at":"2026-08-05T20:28:51.876984Z","title":"Ma et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.876984Z"},"links":{"cited_paper":"/paper/2412.14457","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:cbc826d6ab5e277489287a23935ffd8b114d0882033058a1677a182357321be5","observation_id":"9235856d-cb35-4fec-8c01-e346cd6034cb","resolution":{"observed_at":"2026-08-05T20:28:51.876984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:51.969062Z","title":"Ren et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:51.969062Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:77dfe6221f6c5d8c406f91b552c04747074c859813622d5302f157512ec29450","observation_id":"2f9a4ea2-6a6e-47df-b9ff-e16ec39b4af8","resolution":{"observed_at":"2026-08-05T20:28:51.969062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:52.041893Z","title":"Ma et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:52.041893Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:ad40cfd2515e4bbd28d9e6a0eb13998a0c54bbef4993a88ab5827150a209c60a","observation_id":"08ce3dca-bdba-4435-9668-3dd3dae8d9be","resolution":{"observed_at":"2026-08-05T20:28:52.041893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:52.116884Z","title":"Shen et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:52.116884Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d719326ab4a3d04bb13a89aeb273515b98325cff9ee9652ccd8042f324edbd9b","observation_id":"f8a7af74-cb65-4375-9201-c75d62c4d36a","resolution":{"observed_at":"2026-08-05T20:28:52.116884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:28:52.191294Z","title":"Zhang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:52.191294Z"},"links":{"citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:141545a945d4268e4be1979f98d99af75a204c7ca098c9d25cbac91f83bd5d23","observation_id":"8fe96440-6c2e-44e5-aa81-47ee63b4737a","resolution":{"observed_at":"2026-08-05T20:28:52.191294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 2 inbound Pith citation observations for arXiv:2508.10955."}