{"as_of":"2026-08-08T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8108f7859ef77bb4a733b8a18275e465c8a9acb5bf51238a4a462228ad0321ef","coverage":[{"denominator":135,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:33:42.097727Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22933/citation-record","integrity":"/paper/2507.22933/integrity","json":"/paper/2507.22933/citation-record.json","paper":"/paper/2507.22933"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.03631","last_updated":"2018-12-11T16:42:29Z","snapshot_observed_at":"2026-08-06T17:53:07.939265Z","submitted_at":"2018-12-10T05:36:23Z","title":"Spatial Knowledge Distillation to aid Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.03631","snapshot_observed_at":"2026-08-06T14:33:29.127796Z","title":"Spatial knowledge distillation to aid visual reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:29.127796Z"},"links":{"cited_paper":"/paper/1812.03631","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:5a55537cd2e0f3b3b0663c6f241be088272f8169a1b97d5e58e0fc5d712c9f24","observation_id":"2b5ed89e-d015-4e59-bdd0-47f05ff22454","resolution":{"observed_at":"2026-08-06T14:33:29.127796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:29.645049Z","title":"AQuA: ASP-Based Visual Question Answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:29.645049Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:9a30e9459b6b00a60afc66d16a1da122a9bf6e52c1a88a308395854e69425ef9","observation_id":"b7516853-0591-4f1b-9709-9794466a7b12","resolution":{"observed_at":"2026-08-06T14:33:29.645049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19474","last_updated":"2024-11-25T12:53:44Z","snapshot_observed_at":"2026-08-06T12:49:58.227834Z","submitted_at":"2024-07-28T11:56:03Z","title":"Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19474","snapshot_observed_at":"2026-08-06T14:33:30.145531Z","title":"Visual riddles: a commonsense and world knowledge challenge for large vision and language models.arXiv preprint, arXiv:2407.19474v2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:30.145531Z"},"links":{"cited_paper":"/paper/2407.19474","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:85ad726ed42f54ccaeef489087de573cb2404cf579b1bddb66975025c2da3e2f","observation_id":"8b231a0e-fdb1-4419-b9fa-67498c27854b","resolution":{"observed_at":"2026-08-06T14:33:30.145531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:30.284595Z","title":"Thinking fast and slow in ai","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:30.284595Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:1dd4c0d9356fc97a0099fd6205051670cb0731adc14e81ef7d7855f1d774eb12","observation_id":"cde486f6-7cac-4a0d-b1be-2b8804c12853","resolution":{"observed_at":"2026-08-06T14:33:30.284595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:30.582183Z","title":"Linguistically routing capsule network for out-of-distribution visual question answering.2021 IEEE/CVF International Conference on Computer Vision (ICCV), pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:30.582183Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:a656c58cef768d53234385a1b1808eb461062828795e77247647f5de605681a5","observation_id":"35c08563-9707-4a6a-bf06-4c6b215050f0","resolution":{"observed_at":"2026-08-06T14:33:30.582183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05465","last_updated":"2024-10-14T13:11:55Z","snapshot_observed_at":"2026-08-07T06:30:07.636932Z","submitted_at":"2024-04-08T12:43:32Z","title":"HAMMR: HierArchical MultiModal React agents for generic VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05465","snapshot_observed_at":"2026-08-06T14:33:30.949867Z","title":"Hammr: Hierarchical multimodal react agents for generic vqa.arXiv preprint, arXiv:2404.05465v2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:30.949867Z"},"links":{"cited_paper":"/paper/2404.05465","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:ef69b71e85fb51a82392f875212c19b91db19492080c33290351c0b3d7f099d7","observation_id":"35bc9da5-ae4e-488e-b46b-5a5207bba8d9","resolution":{"observed_at":"2026-08-06T14:33:30.949867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11403","last_updated":"2025-02-04T19:53:04Z","snapshot_observed_at":"2026-08-05T13:29:19.523626Z","submitted_at":"2024-06-17T10:45:47Z","title":"Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11403","snapshot_observed_at":"2026-08-06T14:33:31.064740Z","title":"Multimodal structured generation: Cvpr’s 2nd mmfm challenge technical report.arXiv preprint, arXiv:2406.11403v2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.064740Z"},"links":{"cited_paper":"/paper/2406.11403","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6a499083c5687b2bf95efa452c9abf49f597ae4baee13b2851882de27f27d37f","observation_id":"dc6cb8fe-6699-4bdb-81a8-c81c2b1476a9","resolution":{"observed_at":"2026-08-06T14:33:31.064740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20245","last_updated":"2024-05-30T16:54:42Z","snapshot_observed_at":"2026-08-04T05:39:28.904827Z","submitted_at":"2024-05-30T16:54:42Z","title":"Retrieval Augmented Structured Generation: Business Document Information Extraction As Tool Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20245","snapshot_observed_at":"2026-08-06T14:33:31.242980Z","title":"Retrieval augmented structured generation: Business document information extraction as tool use.arXiv preprint, arXiv:2405.20245v1,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.242980Z"},"links":{"cited_paper":"/paper/2405.20245","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:7ca848f75edb08d1f3c4564a3c5f126216404fa76472b56786a365fe49cd2166","observation_id":"f4e1ee3b-f819-453c-93c6-5f8ffd097bd6","resolution":{"observed_at":"2026-08-06T14:33:31.242980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:31.445980Z","title":"Uncertainty-based visual question answering: Estimating semantic incon- sistency between image and knowledge base","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.445980Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:67f9d057b3ff8e27accd439202c30a013b2cb7a166b059224847eb9bdda879ef","observation_id":"be8cbd0f-0794-4780-b72c-10e02c838b15","resolution":{"observed_at":"2026-08-06T14:33:31.445980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T14:33:31.536273Z","title":"org/CorpusID:212814759","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.536273Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:aecaeb5e6d83a5decf912bdefae600bfb74bcafa19d267ef4d100a7ba920ac14","observation_id":"a7d9639e-f645-4088-80e7-25eeee52864d","resolution":{"observed_at":"2026-08-06T14:33:31.536273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05348","last_updated":"2021-10-18T02:01:02Z","snapshot_observed_at":"2026-08-08T01:50:00.722909Z","submitted_at":"2021-07-12T12:17:18Z","title":"Zero-shot Visual Question Answering using Knowledge Graph","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05348","snapshot_observed_at":"2026-08-06T14:33:31.629947Z","title":"Pan, Zonggang Yuan, and Huajun Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.629947Z"},"links":{"cited_paper":"/paper/2107.05348","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:ee61f86ddc1d07f20d2fe72a3c4686448b3054d3e96b751d7b50c2c6052fb414","observation_id":"5a94369f-d9e9-4c41-8409-346b642dc0e8","resolution":{"observed_at":"2026-08-06T14:33:31.629947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13625","last_updated":"2024-06-14T02:55:46Z","snapshot_observed_at":"2026-07-06T17:33:17.224327Z","submitted_at":"2024-02-21T08:54:47Z","title":"MORE: Multi-mOdal REtrieval Augmented Generative Commonsense Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13625","snapshot_observed_at":"2026-08-06T14:33:31.755675Z","title":"Guo, and Xueqi Cheng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.755675Z"},"links":{"cited_paper":"/paper/2402.13625","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:a29eff56561a54e938370fed86b45e20b3d4eb6c65ee90fda83771559cd63bb7","observation_id":"81f4ea05-5cd9-4796-9a59-6af62f1840fe","resolution":{"observed_at":"2026-08-06T14:33:31.755675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01889","last_updated":"2024-02-02T20:33:14Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:33:14Z","title":"The Role of Foundation Models in Neuro-Symbolic Learning and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01889","snapshot_observed_at":"2026-08-06T14:33:31.919589Z","title":"The role of foundation models in neuro- symbolic learning and reasoning.ArXiv, abs/2402.01889,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.919589Z"},"links":{"cited_paper":"/paper/2402.01889","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:22459cec94e15ca28f179373776116ad835f3baeca1831e5bcd19616f6991f4a","observation_id":"a7405663-718a-43c1-89a3-d915c0f44617","resolution":{"observed_at":"2026-08-06T14:33:31.919589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09717","last_updated":"2022-07-15T17:27:20Z","snapshot_observed_at":"2026-08-05T07:23:46.734523Z","submitted_at":"2021-08-22T13:21:58Z","title":"EKTVQA: Generalized use of External Knowledge to empower Scene Text in Text-VQA","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.09717","snapshot_observed_at":"2026-08-06T14:33:32.034495Z","title":"External knowledge augmented text visual question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.034495Z"},"links":{"cited_paper":"/paper/2108.09717","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:9edd37bda4683aeede6c60ba1c4b47c7179e285fcec86c6beafb983a302a75db","observation_id":"10bb64b2-80d6-411f-bbb3-58e3c1caa9b5","resolution":{"observed_at":"2026-08-06T14:33:32.034495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01064","last_updated":"2023-11-02T08:32:00Z","snapshot_observed_at":"2026-07-06T16:42:04.139453Z","submitted_at":"2023-11-02T08:32:00Z","title":"Multimodal Foundation Models for Zero-shot Animal Species Recognition in Camera Trap Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01064","snapshot_observed_at":"2026-08-06T14:33:32.099441Z","title":"Escucha, Laura Siabatto, Andr’es Link, Pablo Arbel’aez, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.099441Z"},"links":{"cited_paper":"/paper/2311.01064","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:948a9d3db92790f54acf060849d84aa423e56353871c6e4d8c60b9eb5215ef31","observation_id":"75d6735e-c162-4155-b849-1ab0ee2781fb","resolution":{"observed_at":"2026-08-06T14:33:32.099441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11481","last_updated":"2024-07-15T09:54:30Z","snapshot_observed_at":"2026-07-06T17:46:04.063798Z","submitted_at":"2024-03-18T05:07:59Z","title":"VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11481","snapshot_observed_at":"2026-08-06T14:33:32.198959Z","title":"Videoagent: A memory- augmented multimodal agent for video understanding.ArXiv, abs/2403.11481,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.198959Z"},"links":{"cited_paper":"/paper/2403.11481","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:9447100a72e369ef866e084a32092f28511d8903831628040edd8b79b41320c7","observation_id":"13f78976-f146-4f2e-acd1-a6bf30837265","resolution":{"observed_at":"2026-08-06T14:33:32.198959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18842","last_updated":"2023-05-30T08:34:13Z","snapshot_observed_at":"2026-08-06T04:47:40.842518Z","submitted_at":"2023-05-30T08:34:13Z","title":"Generate then Select: Open-ended Visual Question Answering Guided by World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18842","snapshot_observed_at":"2026-08-06T14:33:32.228324Z","title":"Li, William Yang Wang, Zhiguo Wang, Vittorio Castelli, Patrick Ng, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.228324Z"},"links":{"cited_paper":"/paper/2305.18842","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:8cc278eb42ac96394b5a0f8496571df6e9a28b4ec7bd244a8eb5e0f03227e9c6","observation_id":"7e197d21-f03c-46e4-9226-cf6f7983a077","resolution":{"observed_at":"2026-08-06T14:33:32.228324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08148","last_updated":"2023-10-12T09:12:50Z","snapshot_observed_at":"2026-08-07T03:35:51.379594Z","submitted_at":"2023-10-12T09:12:50Z","title":"Open-Set Knowledge-Based Visual Question Answering with Inference Paths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08148","snapshot_observed_at":"2026-08-06T14:33:32.365450Z","title":"URLhttps://proceedings.mlr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.365450Z"},"links":{"cited_paper":"/paper/2310.08148","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:f3e475f7fcf91e4d7a63a1cac821b7908bbd32f0088d37fc3e72525d58a2804a","observation_id":"c4d81b7f-a88f-4521-8290-c6bd12809865","resolution":{"observed_at":"2026-08-06T14:33:32.365450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02962","last_updated":"2021-10-27T02:22:47Z","snapshot_observed_at":"2026-08-04T12:47:58.236220Z","submitted_at":"2019-08-08T08:07:35Z","title":"CRIC: A VQA Dataset for Compositional Reasoning on Vision and Commonsense","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02962","snapshot_observed_at":"2026-08-06T14:33:32.517392Z","title":"Room-object entity prompting and reasoning for embodied referring expression.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46:994–1010, 2023a","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.517392Z"},"links":{"cited_paper":"/paper/1908.02962","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:b223a7b9d1e80be071ecf54a5171c159c1cf584d837e6e5de60ed3e4b5fe6434","observation_id":"2b75d489-02a2-45ee-9225-1c2042dd47bf","resolution":{"observed_at":"2026-08-06T14:33:32.517392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:32.640882Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.640882Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:d1555749bdf7f20cc0b94e1f94d41700fe51064e62d07f151fd231748e957ade","observation_id":"b47f70d0-0c4d-448d-a1ae-c1e91af6e77f","resolution":{"observed_at":"2026-08-06T14:33:32.640882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:32.798914Z","title":"Cross-modal object detection based on a knowledge update.Sensors (Basel, Switzerland), 22, 2022b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.798914Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:ecbe523453e16c7ba2c18591b089b7ca8e1b112929aedcc6b82a305a8f1248e9","observation_id":"d7da0995-7e82-4702-9077-8d170970519a","resolution":{"observed_at":"2026-08-06T14:33:32.798914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00560","last_updated":"2019-04-01T04:37:35Z","snapshot_observed_at":"2026-08-03T19:34:07.414067Z","submitted_at":"2019-04-01T04:37:35Z","title":"Scene Graph Generation with External Knowledge and Image Reconstruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00560","snapshot_observed_at":"2026-08-06T14:33:32.838823Z","title":"Scene graph generation with external knowledge and image reconstruction.arXiv preprint, arXiv:1904.00560v1,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.838823Z"},"links":{"cited_paper":"/paper/1904.00560","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:9b0d315c17aff11c96cd81061d7b071d95e5a7a5a448dc3623dca37a798a190c","observation_id":"242ef5ae-5af6-455d-bc93-4c5823daedab","resolution":{"observed_at":"2026-08-06T14:33:32.838823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-06T14:33:32.886456Z","title":"Hauptmann, Yonatan Bisk, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.886456Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:e60de7f4896b663f7bbc917cc6f0c5c0b38f38e9b7ab261fe69e1d3501af3115","observation_id":"c52725fd-73e1-406e-99ad-cbe082c6f92f","resolution":{"observed_at":"2026-08-06T14:33:32.886456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11559","last_updated":"2022-11-18T18:50:09Z","snapshot_observed_at":"2026-08-05T09:04:05.570299Z","submitted_at":"2022-11-18T18:50:09Z","title":"Visual Programming: Compositional visual reasoning without training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11559","snapshot_observed_at":"2026-08-06T14:33:32.978926Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.978926Z"},"links":{"cited_paper":"/paper/2211.11559","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:b4ba13e6d27636212579580f0dd4697697529ebe300cf486172089fcc8ef3bbe","observation_id":"d3a5bc0b-4cf7-4701-9138-2d6a1f413096","resolution":{"observed_at":"2026-08-06T14:33:32.978926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08108","last_updated":"2021-04-16T13:27:45Z","snapshot_observed_at":"2026-08-02T00:30:54.000597Z","submitted_at":"2021-04-16T13:27:45Z","title":"Cross-Modal Retrieval Augmentation for Multi-Modal Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08108","snapshot_observed_at":"2026-08-06T14:33:33.090097Z","title":"Neverova, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.090097Z"},"links":{"cited_paper":"/paper/2104.08108","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:3d8751f65584ea319fa200c1c690e92d6bcc900adc06350f4535a195dabc8547","observation_id":"305b795c-83da-47fc-9c41-ac2cd71274d4","resolution":{"observed_at":"2026-08-06T14:33:33.090097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10037","last_updated":"2024-03-15T06:06:06Z","snapshot_observed_at":"2026-08-04T07:25:01.965997Z","submitted_at":"2024-03-15T06:06:06Z","title":"Knowledge Condensation and Reasoning for Knowledge-based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10037","snapshot_observed_at":"2026-08-06T14:33:33.190135Z","title":"Knowledge condensation and reasoning for knowledge-based vqa.ArXiv, abs/2403.10037, 2024a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.190135Z"},"links":{"cited_paper":"/paper/2403.10037","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:aec7a05ad0018af3c5d9375d71e0159715be2c6fee1a50d4eb100d57bd4534c9","observation_id":"af157ac8-0280-4633-8fb1-b71a1496c831","resolution":{"observed_at":"2026-08-06T14:33:33.190135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10448","last_updated":"2022-04-22T00:49:50Z","snapshot_observed_at":"2026-08-03T06:36:24.155627Z","submitted_at":"2022-04-22T00:49:50Z","title":"Hypergraph Transformer: Weakly-supervised Multi-hop Reasoning for Knowledge-based Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10448","snapshot_observed_at":"2026-08-06T14:33:33.309138Z","title":"Heo, Eun-Sol Kim, Woo Suk Choi, and Byoung-Tak Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.309138Z"},"links":{"cited_paper":"/paper/2204.10448","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:1f75a474fe8856189a69febcc5213c4ccb26693ecbf1420234436decc410fba3","observation_id":"5f7f103d-d20e-404a-8951-0119b546812a","resolution":{"observed_at":"2026-08-06T14:33:33.309138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T14:33:33.424386Z","title":"Jingyi Hou, Xinxiao Wu, Xiaoxun Zhang, Yayun Qi, Yunde Jia, and Jiebo Luo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.424386Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6b356e15ab6a7f1eb14a4c2ee107391d30e3369574edf67b0ac8f38c96e1e029","observation_id":"3c12baba-5d6d-4208-bbee-9f3a37ea0b62","resolution":{"observed_at":"2026-08-06T14:33:33.424386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00675","last_updated":"2023-08-01T17:21:38Z","snapshot_observed_at":"2026-07-06T16:01:22.379561Z","submitted_at":"2023-08-01T17:21:38Z","title":"Tool Documentation Enables Zero-Shot Tool-Usage with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00675","snapshot_observed_at":"2026-08-06T14:33:33.565983Z","title":"Ratner, Chen-Yu Lee, Ranjay Krishna, and Tomas Pfister","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.565983Z"},"links":{"cited_paper":"/paper/2308.00675","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:3b6e49e6c513639aeec086ef0171bb71ac8d327a4f7c8dad09293e5872f033eb","observation_id":"fcee05e0-2bca-4e21-a978-d0b43612fd93","resolution":{"observed_at":"2026-08-06T14:33:33.565983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-06T14:33:33.739981Z","title":"An, Mengliang Zhang, Liangchen Liu, Kazuma Kobayashi, Tatsuya Harada, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.739981Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:dda08379b3d0ba3b04d3dfff43f2ce2d729a5d503bcaa9105c14bc9f2e05c548","observation_id":"474ce44a-9320-46cf-baa5-8e0de07e3743","resolution":{"observed_at":"2026-08-06T14:33:33.739981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:33.845656Z","title":"Schmid, David A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.845656Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6f01440cb375b12e3fc9111c12e043cddff995bc3a31aa46618567872c0f073b","observation_id":"8b445b9f-da78-40c0-a183-7914780761c7","resolution":{"observed_at":"2026-08-06T14:33:33.845656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08129","last_updated":"2023-11-02T07:54:37Z","snapshot_observed_at":"2026-07-06T15:42:18.360486Z","submitted_at":"2023-06-13T20:50:22Z","title":"AVIS: Autonomous Visual Information Seeking with Large Language Model Agent","version":3},"cited_work":{"arxiv_id":"2306.08129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.08129","snapshot_observed_at":"2026-08-06T14:33:51.675732Z","title":"AVIS: Autonomous Visual Information Seeking with Large Language Model Agent","venue":"cs.CV","work_id":"411d6665-638f-448f-bd83-eb955f0e16bd","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.975118Z"},"links":{"cited_paper":"/paper/2306.08129","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:bef7f5200480c54560923244c8e8dcc9cfc7d137c399d58cdab6ff163c4d04ac","observation_id":"231d22e9-998e-416a-b493-c25990000920","resolution":{"observed_at":"2026-08-06T14:33:51.721138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.03950","last_updated":"2019-11-25T10:02:05Z","snapshot_observed_at":"2026-07-06T08:06:25.449351Z","submitted_at":"2019-07-09T03:08:41Z","title":"Learning by Abstraction: The Neural State Machine","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.03950","snapshot_observed_at":"2026-08-06T14:33:34.144898Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.144898Z"},"links":{"cited_paper":"/paper/1907.03950","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:f5c8e8fb9b1db803eb86a03fea5cc7456bdf4ad8898ea1f7ad4ba1301281f358","observation_id":"60510c9d-9425-4d1b-b40b-6fdb131b6efe","resolution":{"observed_at":"2026-08-06T14:33:34.144898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:34.272947Z","title":"Shahzad, and M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.272947Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:8e1a5bd56f98080dbb1fcfb9009ebcbfc0ac486e4a387caf7df53a928dbb83eb","observation_id":"50696577-8904-4c7e-a6df-2218803de19e","resolution":{"observed_at":"2026-08-06T14:33:34.272947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07196","last_updated":"2024-02-21T16:55:00Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T15:52:02Z","title":"Retrieval-Enhanced Contrastive Vision-Text Models","version":2},"cited_work":{"arxiv_id":"2306.07196","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.07196","snapshot_observed_at":"2026-08-06T14:33:51.500518Z","title":"Retrieval-Enhanced Contrastive Vision-Text Models","venue":"cs.CV","work_id":"f5b7c87d-501a-456f-8c9e-5a1e6d2a3244","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.426589Z"},"links":{"cited_paper":"/paper/2306.07196","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:cbfb331aa1368242af42e860b2fed34553c49cd8ad0410809fa8df8649d1ce25","observation_id":"b05febb3-bd38-4659-bc3d-102f49733d5c","resolution":{"observed_at":"2026-08-06T14:33:51.551631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:34.543307Z","title":"Jamshed and M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.543307Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:f34597441ea9f4ba01486d80a2f40e1435931c70445a281ca8ae33a4e0632fd5","observation_id":"2660c230-13c2-4114-bfd0-4b69abccb51d","resolution":{"observed_at":"2026-08-06T14:33:34.543307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09994","last_updated":"2024-06-14T13:07:46Z","snapshot_observed_at":"2026-08-04T13:54:16.196253Z","submitted_at":"2024-06-14T13:07:46Z","title":"Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models","version":1},"cited_work":{"arxiv_id":"2406.09994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09994","snapshot_observed_at":"2026-08-06T14:33:51.375589Z","title":"Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models","venue":"cs.CL","work_id":"e3c2b601-1ac9-4eb0-bae7-6d670156eb3d","year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.643711Z"},"links":{"cited_paper":"/paper/2406.09994","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:8502b105b6a7a6bf589bf5442e32c91b2d6b6ffea1b940db29b9bf73e56b06f3","observation_id":"db10c290-628d-4315-8122-b6f8750cf1bd","resolution":{"observed_at":"2026-08-06T14:33:51.432525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18373","last_updated":"2023-05-28T04:49:01Z","snapshot_observed_at":"2026-07-06T15:34:55.654928Z","submitted_at":"2023-05-28T04:49:01Z","title":"KAFA: Rethinking Image Ad Understanding with Knowledge-Augmented Feature Adaptation of Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2305.18373","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18373","snapshot_observed_at":"2026-08-06T14:33:51.205228Z","title":"KAFA: Rethinking Image Ad Understanding with Knowledge-Augmented Feature Adaptation of Vision-Language Models","venue":"cs.CV","work_id":"ccd2951f-73c9-4428-aa2d-72143f82baf4","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.754873Z"},"links":{"cited_paper":"/paper/2305.18373","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:3cafcfb2b9dff6f0f4fa30243cf332a3b21e5e8538226c5cf3f8d4db120bdc5a","observation_id":"17076408-d210-4df5-abd3-7e1b2935b392","resolution":{"observed_at":"2026-08-06T14:33:51.256296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:34.883568Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.883568Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:f953e4554445be3940dd4113c4420de559de7ba40591b26b68318e98bafe9d07","observation_id":"355fc88c-1278-4f15-a50b-425e4a6823f1","resolution":{"observed_at":"2026-08-06T14:33:34.883568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12543","last_updated":"2020-05-03T20:29:05Z","snapshot_observed_at":"2026-07-06T08:40:33.992386Z","submitted_at":"2019-11-28T05:55:42Z","title":"How Can We Know What Language Models Know?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12543","snapshot_observed_at":"2026-08-06T14:33:34.997393Z","title":"Xu, Jun Araki, and Graham Neubig","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:34.997393Z"},"links":{"cited_paper":"/paper/1911.12543","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:d6c39c641b4f7cb747bc24f721652b6f51d9b5f5f10a0751a1de19ec4c1d0067","observation_id":"84226f4a-59d7-4408-9bb8-c55828f11079","resolution":{"observed_at":"2026-08-06T14:33:34.997393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.06890","last_updated":"2016-12-20T21:40:40Z","snapshot_observed_at":"2026-07-06T05:23:33.117300Z","submitted_at":"2016-12-20T21:40:40Z","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.06890","snapshot_observed_at":"2026-08-06T14:33:35.054365Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.054365Z"},"links":{"cited_paper":"/paper/1612.06890","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:c0c1df3cc758d72e859d525f1c9e9499bc5450a29877a40da9334655831b8969","observation_id":"67d66ebf-a1ef-4fc6-93d4-edb07ff9c1a8","resolution":{"observed_at":"2026-08-06T14:33:35.054365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:35.176470Z","title":"Knowledge-aware prompt tuning for generalizable vision-language models.2023 IEEE/CVF International Conference on Computer Vision (ICCV), pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.176470Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:bde07c5699c5a3ee2095b1b07c9e886cb01ef422dddfb517557aa496e1bbc5f9","observation_id":"94452ba9-1d03-4dad-a326-b38f60a5fa29","resolution":{"observed_at":"2026-08-06T14:33:35.176470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T14:33:35.301992Z","title":"Mahmoud Khademi, Ziyi Yang, F","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.301992Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6ede35372588518c2b38eb50af9dfc483f2c8894bc83f5f3ba9f7239659277ea","observation_id":"7a11f80c-2da5-4677-9d7e-9fddc4b4fcfd","resolution":{"observed_at":"2026-08-06T14:33:35.301992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12065","last_updated":"2024-07-11T20:16:09Z","snapshot_observed_at":"2026-07-06T18:02:06.709537Z","submitted_at":"2024-04-18T10:25:42Z","title":"RAGAR, Your Falsehood Radar: RAG-Augmented Reasoning for Political Fact-Checking using Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12065","snapshot_observed_at":"2026-08-06T14:33:35.436289Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.436289Z"},"links":{"cited_paper":"/paper/2404.12065","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:747806ee1346fbf249fcc4392a5b1673f6ae480b32aad4c1679cdea4c8d86012","observation_id":"f99d6b87-f9a2-4066-8d17-5af24235b8b4","resolution":{"observed_at":"2026-08-06T14:33:35.436289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06411","last_updated":"2023-11-10T22:14:26Z","snapshot_observed_at":"2026-08-05T10:52:53.465679Z","submitted_at":"2023-11-10T22:14:26Z","title":"Analyzing Modular Approaches for Visual Question Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06411","snapshot_observed_at":"2026-08-06T14:33:35.576006Z","title":"Breslin, and E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.576006Z"},"links":{"cited_paper":"/paper/2311.06411","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:fe78b11779634dca1e8536d98cf66735f10e9e5a3f2b1f4622a75c0edd784afd","observation_id":"902e3389-e2ad-4cfd-9a77-25037ab00231","resolution":{"observed_at":"2026-08-06T14:33:35.576006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-06T14:33:35.672466Z","title":"Visualwebarena: Evaluating multimodal agents on realistic visual web tasks.arXiv preprint, arXiv:2401.13649v2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.672466Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:316114820db59acdf5f41107396b7288ff9eb8802c1fabc5e5ba082c936b88dc","observation_id":"f0e62834-e335-45c8-a7e1-4bf4b6d4e485","resolution":{"observed_at":"2026-08-06T14:33:35.672466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-07-06T04:47:08.658688Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-06T14:33:35.781511Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.781511Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:d61044ec65783d2ca1bea252d63587491a14ebe7c4a232caccbc336b008f9fcb","observation_id":"30899bee-993b-46e9-9f36-8f52f16528e6","resolution":{"observed_at":"2026-08-06T14:33:35.781511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03854","last_updated":"2022-05-08T12:44:51Z","snapshot_observed_at":"2026-08-04T11:06:46.813198Z","submitted_at":"2022-05-08T12:44:51Z","title":"Introduction to Soar","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.03854","snapshot_observed_at":"2026-08-06T14:33:35.923364Z","title":"Jaeyun Lee and Incheol Kim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:35.923364Z"},"links":{"cited_paper":"/paper/2205.03854","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6756a03ff84d7310be818cf3adf192c50a2288f80e3d909c57d65eb88225be64","observation_id":"ee10abd9-2a54-4e3a-a0bb-c57f26c97a14","resolution":{"observed_at":"2026-08-06T14:33:35.923364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02030","last_updated":"2024-06-05T03:28:01Z","snapshot_observed_at":"2026-08-06T04:48:58.920073Z","submitted_at":"2024-06-04T07:13:23Z","title":"Multimodal Reasoning with Multimodal Knowledge Graph","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02030","snapshot_observed_at":"2026-08-06T14:33:36.019772Z","title":"Multimodal reasoning with multimodal knowledge graph","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.019772Z"},"links":{"cited_paper":"/paper/2406.02030","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:95a880300cf8e3ca68dd236af5cd5803e8e33b305348552b532db24eae4f0c07","observation_id":"428497d6-5ca8-41f1-8b8d-9e302d79dd67","resolution":{"observed_at":"2026-08-06T14:33:36.019772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00733","last_updated":"2017-12-03T08:41:35Z","snapshot_observed_at":"2026-07-06T06:12:26.699496Z","submitted_at":"2017-12-03T08:41:35Z","title":"Incorporating External Knowledge to Answer Open-Domain Visual Questions with Dynamic Memory Networks","version":1},"cited_work":{"arxiv_id":"1712.00733","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00733","snapshot_observed_at":"2026-08-06T14:33:50.833280Z","title":"Incorporating External Knowledge to Answer Open-Domain Visual Questions with Dynamic Memory Networks","venue":"cs.CV","work_id":"2c0134dc-5d2b-4c8d-8775-222bb380ef6f","year":2017},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.210167Z"},"links":{"cited_paper":"/paper/1712.00733","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:24342af16221b982627244d896ab61e624290f93c283c51208c0996c9f585431","observation_id":"141cd059-487c-4696-8fa5-f7180f3eef0c","resolution":{"observed_at":"2026-08-06T14:33:50.923535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.11903","last_updated":"2018-11-29T01:11:16Z","snapshot_observed_at":"2026-07-06T07:17:47.895385Z","submitted_at":"2018-11-29T01:11:16Z","title":"Visual Question Answering as Reading Comprehension","version":1},"cited_work":{"arxiv_id":"1811.11903","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.11903","snapshot_observed_at":"2026-08-06T14:33:50.687062Z","title":"Visual Question Answering as Reading Comprehension","venue":"cs.CV","work_id":"f779ae2e-6b7b-4436-9cd3-3ef27b1c0b9e","year":2018},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.369985Z"},"links":{"cited_paper":"/paper/1811.11903","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:dcd674d612a219b883d055d1cb547aef9184889925679f7eb38123bceb682d04","observation_id":"67518e60-73e7-464c-bafd-eef55c592d11","resolution":{"observed_at":"2026-08-06T14:33:50.733235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11100","last_updated":"2024-03-23T09:14:19Z","snapshot_observed_at":"2026-07-06T13:12:43.190154Z","submitted_at":"2022-05-23T07:51:15Z","title":"Supporting Vision-Language Model Inference with Confounder-pruning Knowledge Prompt","version":2},"cited_work":{"arxiv_id":"2205.11100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.11100","snapshot_observed_at":"2026-08-06T14:33:50.538549Z","title":"Supporting Vision-Language Model Inference with Confounder-pruning Knowledge Prompt","venue":"cs.CV","work_id":"f29da394-17f1-4f6f-a1ef-b35bd3c834e3","year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.489057Z"},"links":{"cited_paper":"/paper/2205.11100","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:8c5dc5ce6a10be8937b849316f7186fb0a89bd08ae49a391564e1eef828f913b","observation_id":"e0dbbc37-0153-40f7-a113-993d10f73528","resolution":{"observed_at":"2026-08-06T14:33:50.584470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13625","last_updated":"2023-09-24T12:56:40Z","snapshot_observed_at":"2026-07-06T16:22:54.872252Z","submitted_at":"2023-09-24T12:56:40Z","title":"GraphAdapter: Tuning Vision-Language Models With Dual Knowledge Graph","version":1},"cited_work":{"arxiv_id":"2309.13625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13625","snapshot_observed_at":"2026-08-06T14:33:50.421246Z","title":"GraphAdapter: Tuning Vision-Language Models With Dual Knowledge Graph","venue":"cs.CV","work_id":"67d7924f-58fd-44a0-9b20-596ca4eec3ba","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.593062Z"},"links":{"cited_paper":"/paper/2309.13625","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:c79fb4ad5f58b74ab3ae5ffd324242a19167655198fa78ad2fd94217f52231d9","observation_id":"13061f17-06f0-4bd2-9439-ad74f130ac88","resolution":{"observed_at":"2026-08-06T14:33:50.470486Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00259","last_updated":"2023-06-01T03:57:12Z","snapshot_observed_at":"2026-07-06T14:25:28.974939Z","submitted_at":"2022-12-01T03:53:24Z","title":"Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2212.00259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.00259","snapshot_observed_at":"2026-08-06T14:33:50.243458Z","title":"Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning","venue":"cs.CV","work_id":"a624972d-0cb0-421c-83be-1c1e93343a20","year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.708293Z"},"links":{"cited_paper":"/paper/2212.00259","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:3f4799305a03ef1f660c8a0bd3463a8e978d654992aa51f09f187d3d1e3f8ae2","observation_id":"6dca3c25-287b-40ed-9bc5-f95a92bdbfcb","resolution":{"observed_at":"2026-08-06T14:33:50.306626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13073","last_updated":"2021-06-23T09:48:55Z","snapshot_observed_at":"2026-08-08T12:12:19.666730Z","submitted_at":"2021-05-27T11:45:29Z","title":"Maria: A Visual Experience Powered Conversational Agent","version":2},"cited_work":{"arxiv_id":"2105.13073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.13073","snapshot_observed_at":"2026-08-06T14:33:50.089194Z","title":"Maria: A Visual Experience Powered Conversational Agent","venue":"cs.CL","work_id":"66b05712-d462-4d7c-b6e5-bf9e8dbd64a4","year":2021},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.793809Z"},"links":{"cited_paper":"/paper/2105.13073","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:0b33d580d07edbbb90a131e4a5290723019f828b6dff0bc4d4725586aba83528","observation_id":"9dc30605-c63c-42ec-8e71-f099eebd1f2a","resolution":{"observed_at":"2026-08-06T14:33:50.142739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14204","last_updated":"2023-04-26T01:26:19Z","snapshot_observed_at":"2026-07-06T15:20:45.845539Z","submitted_at":"2023-04-26T01:26:19Z","title":"Towards Medical Artificial General Intelligence via Knowledge-Enhanced Multimodal Pretraining","version":1},"cited_work":{"arxiv_id":"2304.14204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.14204","snapshot_observed_at":"2026-08-06T14:33:49.960222Z","title":"Towards Medical Artificial General Intelligence via Knowledge-Enhanced Multimodal Pretraining","venue":"cs.AI","work_id":"e0f01762-3097-41fe-8a7a-4e48d81a6a30","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:36.879907Z"},"links":{"cited_paper":"/paper/2304.14204","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:683730d2c87baf467da708ce9a232045828dfc6aa3d5d36c2bc3cc5370b79a84","observation_id":"0008139f-312f-44ea-85ae-b4c5eb729170","resolution":{"observed_at":"2026-08-06T14:33:50.007188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17133","last_updated":"2023-10-28T16:03:35Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T10:54:10Z","title":"Fine-grained Late-interaction Multi-modal Retrieval for Retrieval Augmented Visual Question Answering","version":2},"cited_work":{"arxiv_id":"2309.17133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17133","snapshot_observed_at":"2026-08-06T14:33:49.859584Z","title":"Fine-grained Late-interaction Multi-modal Retrieval for Retrieval Augmented Visual Question Answering","venue":"cs.CL","work_id":"05176ebe-c322-4692-82bf-650e9b53c68f","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.003011Z"},"links":{"cited_paper":"/paper/2309.17133","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:2083bbc3b5230ddab7f4d10745a0898a5692f317bd42ee355f5c95e633d1051a","observation_id":"3827c1f7-8752-4305-82b5-2721a1fcc27a","resolution":{"observed_at":"2026-08-06T14:33:49.905173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15946","last_updated":"2023-06-28T06:08:20Z","snapshot_observed_at":"2026-07-06T15:47:38.256580Z","submitted_at":"2023-06-28T06:08:20Z","title":"Knowledge-Enhanced Hierarchical Information Correlation Learning for Multi-Modal Rumor Detection","version":1},"cited_work":{"arxiv_id":"2306.15946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.15946","snapshot_observed_at":"2026-08-06T14:33:49.689916Z","title":"Knowledge-Enhanced Hierarchical Information Correlation Learning for Multi-Modal Rumor Detection","venue":"cs.CV","work_id":"14d6dbd4-031e-4f36-ba1a-c8a6eb7dfd8b","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.129951Z"},"links":{"cited_paper":"/paper/2306.15946","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:3286849309391483895a9f5bced652b05046de85702cd63dc00c94167ef7170c","observation_id":"8de2450d-5709-4b81-83fe-8a020939aea5","resolution":{"observed_at":"2026-08-06T14:33:49.767228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-06T14:33:37.251420Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.251420Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:2c4a5504139d93595fc85e2c7bcb8891d2be7b48c540c230fc6ee46e76d7453d","observation_id":"13d2176b-db56-4ac4-856e-40753e4f798d","resolution":{"observed_at":"2026-08-06T14:33:37.251420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09842","last_updated":"2023-10-31T17:43:39Z","snapshot_observed_at":"2026-07-06T15:17:37.705662Z","submitted_at":"2023-04-19T17:47:47Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09842","snapshot_observed_at":"2026-08-06T14:33:37.359408Z","title":"Wu, Song-Chun Zhu, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.359408Z"},"links":{"cited_paper":"/paper/2304.09842","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:484247d8cd97f89d1d9cf833ebc5a92a187e39e404fa40c8d6ef32b112428a05","observation_id":"c5512e85-dffb-4880-b213-28477b0d6502","resolution":{"observed_at":"2026-08-06T14:33:37.359408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06177","last_updated":"2020-02-19T17:48:05Z","snapshot_observed_at":"2026-07-06T08:57:23.533169Z","submitted_at":"2020-02-14T18:55:56Z","title":"The Next Decade in AI: Four Steps Towards Robust Artificial Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06177","snapshot_observed_at":"2026-08-06T14:33:37.432857Z","title":"Kenneth Marino, Mohammad Rastegari, Ali Farhadi, and Roozbeh Mottaghi","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.432857Z"},"links":{"cited_paper":"/paper/2002.06177","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:5dff569f910c5dc0d830f486c31c8fafb7b9d0aa705a5bb61d2bea064f2b79ff","observation_id":"7045fb5e-9452-481a-a601-42663d5d60e6","resolution":{"observed_at":"2026-08-06T14:33:37.432857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:37.550363Z","title":"Gupta, and Marcus Rohrbach","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.550363Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:76ce236469bd4728f50a860c454e7b0c5e1d8769f0c3d732bcd9e02eb78a4fdc","observation_id":"ff7aa1ac-675a-4435-a58b-54fea219b2cf","resolution":{"observed_at":"2026-08-06T14:33:37.550363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:37.641589Z","title":"Uijlings, Lluís Castrejón, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.641589Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:109420608438a32d76d3d0dc764857b26d465b75672c93fa78acb19612557454","observation_id":"08797055-7001-4854-8740-1abf11d14df3","resolution":{"observed_at":"2026-08-06T14:33:37.641589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-06T14:33:37.755569Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models.arXiv preprint, arXiv:2410.05229v1,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.755569Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:225487ad13ba89b0120bb786fb36278597d5e94b82324ac8b5a22bd81aecd584","observation_id":"7b16d1ac-993a-43f0-a05e-64ff63a8c3bc","resolution":{"observed_at":"2026-08-06T14:33:37.755569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:37.878901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.878901Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:36bba2d7acb51b7816401a29d30c87ad75919ff2628bc096fd95e0029b6e6203","observation_id":"740733e0-1d8c-40ca-8e5d-26c0c27ea79a","resolution":{"observed_at":"2026-08-06T14:33:37.878901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19773","last_updated":"2024-05-30T07:38:58Z","snapshot_observed_at":"2026-07-06T18:22:31.384923Z","submitted_at":"2024-05-30T07:38:58Z","title":"VQA Training Sets are Self-play Environments for Generating Few-shot Pools","version":1},"cited_work":{"arxiv_id":"2405.19773","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.19773","snapshot_observed_at":"2026-08-06T14:33:49.489761Z","title":"VQA Training Sets are Self-play Environments for Generating Few-shot Pools","venue":"cs.CV","work_id":"c64d5192-e94d-47cc-a490-2f995091d5eb","year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.982939Z"},"links":{"cited_paper":"/paper/2405.19773","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:08030b23fbd46529a95bd0de255830b761bde36b5b911e8dd01fa2b2cd0a0de2","observation_id":"c71edbd1-d4e4-4265-b0db-2f3ef20b880c","resolution":{"observed_at":"2026-08-06T14:33:49.530589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11309","last_updated":"2022-06-13T23:26:16Z","snapshot_observed_at":"2026-08-03T23:42:31.942314Z","submitted_at":"2021-10-21T17:41:56Z","title":"Fast Model Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11309","snapshot_observed_at":"2026-08-06T14:33:38.133495Z","title":"LudovicoMitchener, DavidTuckey, MatthewCrosby, andA.Russo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.133495Z"},"links":{"cited_paper":"/paper/2110.11309","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:35191dcc2b0bba9898752bbe39ab1233041028e4b1ee90e413579d010cdd64e7","observation_id":"d7941ab1-49a2-4770-b62f-7faffac0ebb9","resolution":{"observed_at":"2026-08-06T14:33:38.133495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.10185","last_updated":"2017-11-28T09:00:55Z","snapshot_observed_at":"2026-07-06T06:11:33.851115Z","submitted_at":"2017-11-28T09:00:55Z","title":"Hyper-dimensional computing for a visual question-answering system that is trainable end-to-end","version":1},"cited_work":{"arxiv_id":"1711.10185","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.10185","snapshot_observed_at":"2026-08-06T14:33:49.359728Z","title":"Hyper-dimensional computing for a visual question-answering system that is trainable end-to-end","venue":"cs.AI","work_id":"410f38c1-cce3-456f-85b3-62cc15f9725c","year":2017},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.220218Z"},"links":{"cited_paper":"/paper/1711.10185","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:a32d9cffd73c6d84a1d76b2e063051874449b6ba6af1c71684030afb013db263","observation_id":"3390a54d-51f7-437b-b1ba-8ffedf266925","resolution":{"observed_at":"2026-08-06T14:33:49.412597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01124","last_updated":"2018-09-04T17:59:55Z","snapshot_observed_at":"2026-08-01T16:13:23.923067Z","submitted_at":"2018-09-04T17:59:55Z","title":"Straight to the Facts: Learning Knowledge Base Retrieval for Factual Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1809.01124","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.01124","snapshot_observed_at":"2026-08-06T14:33:49.163209Z","title":"Straight to the Facts: Learning Knowledge Base Retrieval for Factual Visual Question Answering","venue":"cs.CV","work_id":"5100df70-f00b-4fbc-8ac2-9356d2bd73e7","year":2018},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.308600Z"},"links":{"cited_paper":"/paper/1809.01124","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:f77e75e680891e893d7b0042fa5d5fdba0182e436b3895f36935cb5e0b8581b2","observation_id":"266efa4a-04cd-455f-9cb2-43637f5f826f","resolution":{"observed_at":"2026-08-06T14:33:49.254650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00538","last_updated":"2018-11-01T17:59:56Z","snapshot_observed_at":"2026-07-06T07:12:05.508124Z","submitted_at":"2018-11-01T17:59:56Z","title":"Out of the Box: Reasoning with Graph Convolution Nets for Factual Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1811.00538","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.00538","snapshot_observed_at":"2026-08-06T14:33:49.069678Z","title":"Out of the Box: Reasoning with Graph Convolution Nets for Factual Visual Question Answering","venue":"cs.CV","work_id":"5b4b0f05-422b-4112-8ed9-a11b0439d3f9","year":2018},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.465430Z"},"links":{"cited_paper":"/paper/1811.00538","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:7e5d2eaede5c7803126b416a01d0ae1ff283c9d7b83fd1a9d0e27ab6cd3ac9ff","observation_id":"0373640a-fd1a-40b4-a802-de015ad8cef0","resolution":{"observed_at":"2026-08-06T14:33:49.102227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:38.574871Z","title":"External commonsense knowledge as a modality for social intelligence question-answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.574871Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:449b4d4abc7752eeac3e09110484d5ae25e5aa792eca6105c3beace230a498f6","observation_id":"6b9c9dee-1b6b-438f-8cbf-93c910a3d696","resolution":{"observed_at":"2026-08-06T14:33:38.574871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07945","last_updated":"2024-02-09T02:33:45Z","snapshot_observed_at":"2026-08-03T19:20:57.982939Z","submitted_at":"2024-02-09T02:33:45Z","title":"ScreenAgent: A Vision Language Model-driven Computer Control Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07945","snapshot_observed_at":"2026-08-06T14:33:38.722140Z","title":"Screenagent: A vision language model-driven computer control agent.ArXiv, abs/2402.07945,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.722140Z"},"links":{"cited_paper":"/paper/2402.07945","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:5c6f102ed04af998cc1febeb796c5e94e4d2f91e1c2da13141ab5355ec56ff1d","observation_id":"72882c68-7b0a-4fce-87b1-35b414ee6a69","resolution":{"observed_at":"2026-08-06T14:33:38.722140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:38.816381Z","title":"Prediction of actions and places by the time series recognition from images with multimodal llm.2024 IEEE 18th International Conference on Semantic Computing (ICSC), pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.816381Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:129516f4e21b61fed745968d4cd0b5bc5e9592f5c3293640d5a386d72c32089f","observation_id":"b9d173f6-613a-4894-bc9e-c2c4620f4a13","resolution":{"observed_at":"2026-08-06T14:33:38.816381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16055","last_updated":"2024-04-21T13:36:14Z","snapshot_observed_at":"2026-07-06T17:49:40.841846Z","submitted_at":"2024-03-24T07:47:00Z","title":"Modal-adaptive Knowledge-enhanced Graph-based Financial Prediction from Monetary Policy Conference Calls with LLM","version":4},"cited_work":{"arxiv_id":"2403.16055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16055","snapshot_observed_at":"2026-08-06T14:33:48.941112Z","title":"Modal-adaptive Knowledge-enhanced Graph-based Financial Prediction from Monetary Policy Conference Calls with LLM","venue":"cs.CE","work_id":"15dd1f09-6a4a-4774-a5c5-51a3d430c425","year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.895950Z"},"links":{"cited_paper":"/paper/2403.16055","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:a7a1ae1ee782bfea3f89d75fbb692de76d071f8a943e8caf9841c95ad031ef29","observation_id":"d1a614cf-10cc-435a-8962-91b2d7a1c31f","resolution":{"observed_at":"2026-08-06T14:33:48.975837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03607","last_updated":"2024-11-17T21:40:50Z","snapshot_observed_at":"2026-08-01T21:24:55.684504Z","submitted_at":"2024-02-06T00:51:27Z","title":"Enhancing Cross-Modal Contextual Congruence for Crowdfunding Success using Knowledge-infused Learning","version":2},"cited_work":{"arxiv_id":"2402.03607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03607","snapshot_observed_at":"2026-08-06T14:33:48.828105Z","title":"Enhancing Cross-Modal Contextual Congruence for Crowdfunding Success using Knowledge-infused Learning","venue":"cs.AI","work_id":"0412c572-dac7-47f7-9764-1e759a233f89","year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:38.957536Z"},"links":{"cited_paper":"/paper/2402.03607","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:71ef5cd5ceb7f853655adc4f49cff353a53f07c3a6354b69d41226d452d256db","observation_id":"b5174dd7-3c72-417f-923b-8f7ed5e2c6fd","resolution":{"observed_at":"2026-08-06T14:33:48.867608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-07-06T15:13:13.695535Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-06T14:33:39.057382Z","title":"Shishir G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.057382Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:4de635cb695ff9bd0294c89dd80e321e011e0f82b54c313d164ac80da68466ae","observation_id":"ad972237-8cf0-43c6-95d8-cc00e671cedd","resolution":{"observed_at":"2026-08-06T14:33:39.057382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-06T14:33:39.206412Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.206412Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:0fb7e34ddb883782f89cc8681e6b75c3364a66d78404d4fa561fffbc773a9c57","observation_id":"f0190988-7b3a-4d4c-803a-5a09aea532be","resolution":{"observed_at":"2026-08-06T14:33:39.206412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-06T14:33:39.386927Z","title":"Jielin Qiu, Andrea Madotto, Zhaojiang Lin, Paul A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.386927Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:3c4466a8f2c916110a8edff76aa53cc79699416466765be9d8d96970edc6d1a0","observation_id":"029fae67-72e3-48c6-a9a4-7ee923bc1138","resolution":{"observed_at":"2026-08-06T14:33:39.386927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00555","last_updated":"2024-08-01T13:38:58Z","snapshot_observed_at":"2026-07-06T18:55:37.298696Z","submitted_at":"2024-08-01T13:38:58Z","title":"Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00555","snapshot_observed_at":"2026-08-06T14:33:39.558793Z","title":"Alleviating hallucination in large vision-language models with active retrieval augmentation.ArXiv, abs/2408.00555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.558793Z"},"links":{"cited_paper":"/paper/2408.00555","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:45c421ee73f3b83e007ba6832636dc10735c163af55f894c08e359fed5616f50","observation_id":"bb157cb8-2692-431f-8a0a-67c212cb6256","resolution":{"observed_at":"2026-08-06T14:33:39.558793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:39.637323Z","title":"Ksf-st: Video captioning based on key semantic frames extraction and spatio-temporal attention mechanism.2020 International Wireless Communications and Mobile Computing (IWCMC), pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.637323Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6ac76406ac98678818f26561eb523cbb5d849d08d807c5e9d35e34b96454f391","observation_id":"7e9876d1-cd47-4057-b6e7-04b2e149e1b2","resolution":{"observed_at":"2026-08-06T14:33:39.637323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T14:33:39.833296Z","title":"Mercy Ranjit, Gopinath Ganapathy, Ranjit Manuel, and Tanuja Ganu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.833296Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:0de6b8156b0a51c9d033d2d78630f949c51db0d5f3ac09aeecc4e31b1b29927f","observation_id":"10b1a622-8177-4cc3-9efa-1a773ebc9c29","resolution":{"observed_at":"2026-08-06T14:33:39.833296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13626","last_updated":"2022-10-24T22:01:17Z","snapshot_observed_at":"2026-07-06T14:09:52.729001Z","submitted_at":"2022-10-24T22:01:17Z","title":"VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge","version":1},"cited_work":{"arxiv_id":"2210.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.13626","snapshot_observed_at":"2026-08-06T14:33:48.627764Z","title":"VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge","venue":"cs.CV","work_id":"e1de794f-c11e-43ca-b193-3db6d392abb1","year":2022},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.912968Z"},"links":{"cited_paper":"/paper/2210.13626","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:cdae2f9f22311d86ab6c54ae46a00ac85c58300d1e456fcd466211b4762f158c","observation_id":"cb293b46-f70b-41e0-b0d5-e7d651d513d1","resolution":{"observed_at":"2026-08-06T14:33:48.677769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:39.993751Z","title":"Outside knowledge visual question answering version 2.0.ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:39.993751Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6fc2a9013e8a9d77c64d696efab54fc02e51ba31942f72c12e8eeeb9a6dbf706","observation_id":"74d88e8a-e7c2-466c-994b-71125f6ddc2d","resolution":{"observed_at":"2026-08-06T14:33:39.993751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.04938","last_updated":"2016-08-09T17:54:52Z","snapshot_observed_at":"2026-07-06T04:46:17.931363Z","submitted_at":"2016-02-16T08:20:14Z","title":"\"Why Should I Trust You?\": Explaining the Predictions of Any Classifier","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.04938","snapshot_observed_at":"2026-08-06T14:33:40.096217Z","title":"Heather Riley and M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:40.096217Z"},"links":{"cited_paper":"/paper/1602.04938","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:15a670fd4736d8d69e8c820928b97aa02d38c8ba0e330bcc9b1e290222d296e9","observation_id":"5f5c5dad-f8e2-4d82-9629-d6530af0c350","resolution":{"observed_at":"2026-08-06T14:33:40.096217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.11251","last_updated":"2021-07-10T01:20:27Z","snapshot_observed_at":"2026-07-06T10:51:45.627033Z","submitted_at":"2021-03-20T21:58:27Z","title":"Interpretable Machine Learning: Fundamental Principles and 10 Grand Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.11251","snapshot_observed_at":"2026-08-06T14:33:40.159564Z","title":"Mrinmaya Sachan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:40.159564Z"},"links":{"cited_paper":"/paper/2103.11251","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:46e5d1710df8eed91142aeb5e8a9dcb7832d6dc2ee8a62e824eea9e63d991a28","observation_id":"833c3f63-3e79-41f5-91e8-d66e8a42f87a","resolution":{"observed_at":"2026-08-06T14:33:40.159564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1184/r1/11898378.v1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:45.389811Z","title":"Alireza Salemi, Juan Altmayer Pizzorno, and Hamed Zamani","venue":null,"work_id":"ac67560a-a255-497c-9836-4006b7e7f6eb","year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:40.311849Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:f8ee77f2c7fe5979bd12529786e665315b70313f3723c7c6a3a0698e89bbaaf9","observation_id":"e7a7a7a0-e4e4-4fe5-a56e-7885a52dc24d","resolution":{"observed_at":"2026-08-06T14:33:45.513542Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-06T14:33:40.468859Z","title":"DustinSchwenk, ApoorvKhandelwal, ChristopherClark, KennethMarino, andRoozbehMottaghi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:40.468859Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:249304aa1846e1882cab6fcf7f8971bb3905376c0f1ed4d0c291c11dbe735c3c","observation_id":"e3b07021-ac50-4269-a91b-1c9318ee16bd","resolution":{"observed_at":"2026-08-06T14:33:40.468859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03761","last_updated":"2024-04-12T06:42:47Z","snapshot_observed_at":"2026-08-04T14:45:39.746654Z","submitted_at":"2023-03-07T09:56:23Z","title":"Graph Neural Networks in Vision-Language Image Understanding: A Survey","version":2},"cited_work":{"arxiv_id":"2303.03761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03761","snapshot_observed_at":"2026-08-06T14:33:48.456831Z","title":"Graph Neural Networks in Vision-Language Image Understanding: A Survey","venue":"cs.CV","work_id":"b975d31b-da50-400c-8402-12b02304a3b8","year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:40.598922Z"},"links":{"cited_paper":"/paper/2303.03761","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:4d70e5b7f96eecc3a42765948c6ff706695dce5ca0b562a74be9333a0c022d35","observation_id":"955cbaf7-2781-4c65-98bc-e04ebfd96c63","resolution":{"observed_at":"2026-08-06T14:33:48.511511Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04422","last_updated":"2016-07-07T12:28:57Z","snapshot_observed_at":"2026-08-06T08:47:11.468321Z","submitted_at":"2016-06-14T15:25:28Z","title":"Logic Tensor Networks: Deep Learning and Logical Reasoning from Data and Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04422","snapshot_observed_at":"2026-08-06T14:33:40.743779Z","title":"Muralikrishnna G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:40.743779Z"},"links":{"cited_paper":"/paper/1606.04422","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:b34f6f19d932ad7c4c8ef01ba9ce45981f280f662725d6a24bc9bc17964c652e","observation_id":"bcb998fe-bf02-441c-81f9-7e249386b5e4","resolution":{"observed_at":"2026-08-06T14:33:40.743779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10311","last_updated":"2025-03-09T19:13:53Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:58:45Z","title":"UniRAG: Universal Retrieval Augmentation for Large Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10311","snapshot_observed_at":"2026-08-06T14:33:40.930906Z","title":"Unirag: Universal retrieval augmentation for multi-modal large language models.ArXiv, abs/2405.10311,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:40.930906Z"},"links":{"cited_paper":"/paper/2405.10311","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:b1afb886c307d34cc00b9192474d737302c655364af8c930aa7e20546693023a","observation_id":"caa90521-d631-4450-abe6-cb924d4d8a5f","resolution":{"observed_at":"2026-08-06T14:33:40.930906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17213","last_updated":"2025-06-05T14:04:01Z","snapshot_observed_at":"2026-07-06T17:35:57.887470Z","submitted_at":"2024-02-27T05:10:44Z","title":"VCD: A Dataset for Visual Commonsense Discovery in Images","version":2},"cited_work":{"arxiv_id":"2402.17213","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17213","snapshot_observed_at":"2026-08-06T14:33:48.306202Z","title":"VCD: A Dataset for Visual Commonsense Discovery in Images","venue":"cs.CV","work_id":"f32aa7dc-0671-4870-8d56-867e09130760","year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.024746Z"},"links":{"cited_paper":"/paper/2402.17213","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:3911cfb68cf0cd1dacc392556f25129c1cd80f6ffd0516e960fb7f579599c584","observation_id":"a638ccbd-41f1-43ea-bb56-70ca68babd8e","resolution":{"observed_at":"2026-08-06T14:33:48.373864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06013","last_updated":"2021-01-15T08:37:55Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T08:37:55Z","title":"Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge","version":1},"cited_work":{"arxiv_id":"2101.06013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.06013","snapshot_observed_at":"2026-08-06T14:33:48.102359Z","title":"Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge","venue":"cs.CV","work_id":"43fc05ea-6f7f-443d-bb1f-473b537011af","year":2021},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.174422Z"},"links":{"cited_paper":"/paper/2101.06013","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:e0f2005a13fb7e2429da61425bb3dc25926c362ffd29f06967b6632f68af1c8a","observation_id":"2ce01051-3615-4af2-a21b-f37b9eceee81","resolution":{"observed_at":"2026-08-06T14:33:48.201075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:41.264804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.264804Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:875084bc1ed94480f12b60e39739ea144a0a11c6d9f24ebfca12359e90879fbb","observation_id":"5b38d500-9f46-473f-84cb-573ed274abcc","resolution":{"observed_at":"2026-08-06T14:33:41.264804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:41.378191Z","title":"Singh, Anand Mishra, Shashank Shekhar, and Anirban Chakraborty","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.378191Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:a0efd85978c2c82d05336155b0f5fef46b7d0c78ca6553a1c24f09c49de30b35","observation_id":"1003a2c8-0f9a-4070-b715-a8eb6d8805a3","resolution":{"observed_at":"2026-08-06T14:33:41.378191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:33:41.423630Z","title":"Liu, Yang Yang, Xuequn Shang, and Mingxuan Sun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.423630Z"},"links":{"citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:936ed1631912412b67ad298f15ba4401bc974fad5a2b1ed6470e5dc7ebcd9b47","observation_id":"ba1a456c-e53a-474f-b604-ce30a00a0bc0","resolution":{"observed_at":"2026-08-06T14:33:41.423630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03975","last_updated":"2018-12-11T16:27:17Z","snapshot_observed_at":"2026-07-06T05:22:25.273447Z","submitted_at":"2016-12-12T23:54:52Z","title":"ConceptNet 5.5: An Open Multilingual Graph of General Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03975","snapshot_observed_at":"2026-08-06T14:33:41.533386Z","title":"Wolfgang Stammer, Antonia Wüst, David Steinmann, and Kristian Kersting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.533386Z"},"links":{"cited_paper":"/paper/1612.03975","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:6b0ff13f0b4f478f8cd3caae26c1f1b55e14ee6f51dfda5051b87aa5585edbc0","observation_id":"5e4337c5-85f7-4126-b9a1-43b3cf67efda","resolution":{"observed_at":"2026-08-06T14:33:41.533386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19593","last_updated":"2025-06-09T21:57:56Z","snapshot_observed_at":"2026-07-06T18:38:13.900206Z","submitted_at":"2024-06-28T01:14:43Z","title":"SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2406.19593","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19593","snapshot_observed_at":"2026-08-06T14:33:47.925079Z","title":"SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs","venue":"cs.CL","work_id":"0a309fd3-21f6-43a3-9e5a-711fd47f48d2","year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.656102Z"},"links":{"cited_paper":"/paper/2406.19593","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:f003aeac0b4a28a37e86c340bba151a415d67c30cc3ad0b6c6bf947f4de23254","observation_id":"170791cf-d1ed-443a-ad18-a75679311381","resolution":{"observed_at":"2026-08-06T14:33:47.991462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.04860","last_updated":"2018-06-13T06:37:42Z","snapshot_observed_at":"2026-08-04T04:12:04.288402Z","submitted_at":"2018-06-13T06:37:42Z","title":"Learning Visual Knowledge Memory Networks for Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1806.04860","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.04860","snapshot_observed_at":"2026-08-06T14:33:47.803724Z","title":"Learning Visual Knowledge Memory Networks for Visual Question Answering","venue":"cs.CV","work_id":"ee0e79ce-2ace-4d80-bfc6-0f620c649099","year":2018},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.772208Z"},"links":{"cited_paper":"/paper/1806.04860","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:bd4a38ca62e9be4cf3a94aeb51e90530f9dc6203452bcb7d5f6106eddadc20f1","observation_id":"35454628-c8b7-44fb-9538-688915989f08","resolution":{"observed_at":"2026-08-06T14:33:47.868348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05392","last_updated":"2023-06-08T17:45:14Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:45:14Z","title":"Modular Visual Question Answering via Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05392","snapshot_observed_at":"2026-08-06T14:33:41.947610Z","title":"Modular visual question answering via code genera- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:41.947610Z"},"links":{"cited_paper":"/paper/2306.05392","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:10605a49599df43fe1facf59b0af8ea73e8e82eaaaa5dc68340e311d4b6198d7","observation_id":"43fc39b9-9292-422a-b382-b8457345f13b","resolution":{"observed_at":"2026-08-06T14:33:41.947610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08128","last_updated":"2023-03-14T17:57:47Z","snapshot_observed_at":"2026-08-02T12:31:34.577778Z","submitted_at":"2023-03-14T17:57:47Z","title":"ViperGPT: Visual Inference via Python Execution for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08128","snapshot_observed_at":"2026-08-06T14:33:42.097727Z","title":"Vipergpt: Visualinferenceviapythonexecutionforreasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:42.097727Z"},"links":{"cited_paper":"/paper/2303.08128","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:156b1e720863bc7471e63b6115cede7568d40e0a007f5ad9308de6cfc322fcb8","observation_id":"baafa8ad-acf8-48ae-84ba-c116dbbfbdb9","resolution":{"observed_at":"2026-08-06T14:33:42.097727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":74,"verified_exact":21,"verified_fuzzy":0},"total_outbound_references":135},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 135 outbound references and 0 inbound Pith citation observations for arXiv:2507.22933."}