{"as_of":"2026-08-09T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26cc69ae50ab0a43211d8ba2e7265d8927f74be6bdd341fb4c0167b7a131f431","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:25:58.596793Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T01:00:27.572834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T11:11:17.919527Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09818","snapshot_observed_at":"2026-08-06T01:00:27.572834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04017","last_updated":"2025-08-06T02:13:46Z","snapshot_observed_at":"2026-08-07T23:48:57.602257Z","submitted_at":"2025-08-06T02:13:46Z","title":"Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T01:00:27.572834Z"},"links":{"cited_paper":"/paper/2502.09818","citing_paper":"/paper/2508.04017"},"observation_digest":"sha256:3db6559060ee8cd8fc9e1fba8e9d4771dd05f8cd15ad967583eab1f5d8682d26","observation_id":"1d1532fb-9e7f-4bea-bd60-4c445ac19072","resolution":{"observed_at":"2026-08-06T01:00:27.572834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"cited_work":{"arxiv_id":"2502.09818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09818","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the robustness of multimodal language model towards distractions","venue":null,"work_id":"1e4cf26b-b2c2-492a-b0bc-142e47d99901","year":2025},"citing_paper":{"arxiv_id":"2510.00626","last_updated":"2026-04-26T15:50:39Z","snapshot_observed_at":"2026-07-06T22:31:20.110402Z","submitted_at":"2025-10-01T07:59:45Z","title":"When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T11:08:08.916893Z"},"links":{"cited_paper":"/paper/2502.09818","citing_paper":"/paper/2510.00626"},"observation_digest":"sha256:2da6b337a24dc3447632d8af13c4c7bd4783a44c02f7fd37052f5a9c1c19e3cf","observation_id":"a79769f4-ea2d-41a4-b959-8c00f88e3b89","resolution":{"observed_at":"2026-05-18T11:11:17.922848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09818/citation-record","integrity":"/paper/2502.09818/integrity","json":"/paper/2502.09818/citation-record.json","paper":"/paper/2502.09818"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.345138Z","title":"Vqa: Visual question answering","venue":null,"work_id":"85d85f68-e40d-4ace-a884-a13860500872","year":2015},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.384098Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:1527a822aea3a7e00d1154930aec8501be628a9a38364f75e55a861dbba6c35a","observation_id":"d37f96c1-4c41-4b8c-919a-0a402e321173","resolution":{"observed_at":"2026-08-07T20:25:59.350990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.325979Z","title":"Choquette- Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":"8c28506f-1305-4b7e-9fa0-197b9845ebc1","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.391159Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:d7a427c4d418d90bd1bb63cf684a955de8111e286432339714c263cb501fe5d7","observation_id":"c5f01393-06f9-4c4a-8a5f-d819ccc290c6","resolution":{"observed_at":"2026-08-07T20:25:59.331941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T20:25:58.396754Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.396754Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:dd76bd52da0998f72c60f77213cbe64ad1d6ad216ddcc634ca0001ff91a85fc9","observation_id":"b75241f2-2493-4802-9562-c21873821f9d","resolution":{"observed_at":"2026-08-07T20:25:58.396754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-07T09:16:51.378562Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-07T20:25:58.403744Z","title":"Halc: Object hallucination re- duction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.403744Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:e41ff77864faf15dd2577f0c14b01fdbc92b7f55585326c1a4b6c39cc43179f7","observation_id":"dffe2634-4015-4213-af49-7a35f2e7c4c4","resolution":{"observed_at":"2026-08-07T20:25:58.403744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.410363Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.410363Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:6c2d21551e8bebac932c2cc5b32b5523e21e68f7549672af327c982074809a9b","observation_id":"1e68e2c4-f4ec-469a-9f33-44081099c8c6","resolution":{"observed_at":"2026-08-07T20:25:58.410363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-02T21:47:41.540245Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-07T20:25:58.416124Z","title":"How Robust is Google’s Bard to Adversarial Image Attacks? arXiv preprint arXiv:2309.11751, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.416124Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:5fa913a480c4eb9055b6a715612d9bbaa633078154e4c067d2ff80185fd7ae17","observation_id":"0cede9a2-b671-4098-82ae-3f68818a795a","resolution":{"observed_at":"2026-08-07T20:25:58.416124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T20:25:58.422649Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.422649Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:44bd898c7b17aea2ed1c4cf4f78208ecb375aaba844bbd63a904b8bc0b49aced","observation_id":"0fb5e3ff-151b-4fce-97c8-024e0321cc11","resolution":{"observed_at":"2026-08-07T20:25:58.422649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.294574Z","title":"Phi3v-finetuning, 2023","venue":null,"work_id":"c6394b6c-593c-4b6f-8dc1-cbde7c761586","year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.429141Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:725687bd2f1c4a15700c346cebba2eec6b075722d954a61fbe44a17c3ad25248","observation_id":"32aa141f-b92e-476b-97fd-c2eb6c6fdb1d","resolution":{"observed_at":"2026-08-07T20:25:59.300025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-07T20:25:58.434448Z","title":"Hallusionbench: An advanced diag- nostic suite for entangled language hallucination & visual illusion in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.434448Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:c34d75abbac8022d88a781746cc0c6a2472504b1790016e71df1a21d8477227b","observation_id":"19b751bb-1b39-44f4-8568-0f24ab94da08","resolution":{"observed_at":"2026-08-07T20:25:58.434448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.275842Z","title":"Cogvlm2: Visual language models for image and video understanding, 2024","venue":null,"work_id":"5890e7e6-9f24-4a79-baf9-02ed69539b15","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.440591Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:dd407fb8954ca9b95c29645633ddc66cdbd8b9e456c48e866fdca103769c1b26","observation_id":"a8e5ac55-2ec6-4eed-b9b3-ba4cff84de8e","resolution":{"observed_at":"2026-08-07T20:25:59.281755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12038","last_updated":"2024-03-22T02:24:57Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T09:55:41Z","title":"Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12038","snapshot_observed_at":"2026-08-07T20:25:58.446123Z","title":"Large multilingual models pivot zero-shot multimodal learning across languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.446123Z"},"links":{"cited_paper":"/paper/2308.12038","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:651b3e7f0f98e31e8a4f6b4655b193e8507f8cb9f9c54ab15cb7b0bd0db294ca","observation_id":"16072865-e658-44f3-ad2a-1c9ca4557ae9","resolution":{"observed_at":"2026-08-07T20:25:58.446123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.256701Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"816edddb-af95-45f7-be08-c7650e9d1a58","year":2019},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.451812Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:536bceaacd60b11d5d7ec60a281590ee32d6fbec11cce3c679a96613d698ad2f","observation_id":"bbc59deb-19da-45ee-865c-468d971daa7f","resolution":{"observed_at":"2026-08-07T20:25:59.262535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.458116Z","title":"Open- clip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.458116Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:420a3447cd729d019dc4107b9adb68c85c61be2b0140fa0675b4bcee3051f787","observation_id":"4a7358af-0757-499b-bb12-dfbab7ebdd5b","resolution":{"observed_at":"2026-08-07T20:25:58.458116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.224411Z","title":"Adversarial examples for evaluating math word problem solvers","venue":null,"work_id":"c1aeb8db-9cf5-412f-846d-7a0aea7d6c8d","year":2021},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.464365Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:c7b12668e8510c6f6353971c5e53fe73078655a8c14da5a6538e69d4a0a0c4b2","observation_id":"a3ac1863-e170-4d35-8487-75b3139b806d","resolution":{"observed_at":"2026-08-07T20:25:59.230192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-06T07:43:56.889679Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T20:25:58.469758Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.469758Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:fba99858d2207224af7b84902803bfe72917fc0b7c5c9f69cd2afb6337d74596","observation_id":"69848a13-51bb-4a10-a771-a3e89c5162d9","resolution":{"observed_at":"2026-08-07T20:25:58.469758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.476188Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.476188Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:279d88e23eee5b8ce49b7d8ee1bd22271a933a71a3b25642fa19039bd9cc9a14","observation_id":"b327ad1f-67ed-4043-8270-8c0e367b89bb","resolution":{"observed_at":"2026-08-07T20:25:58.476188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.193848Z","title":"Visual instruction tuning","venue":null,"work_id":"ade60b5b-3654-4453-ac4f-5f75b0f5dc6b","year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.481824Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:b3c8780be5c9337058784e4e8684347541b6a2a730afb5d373c8ad3140e2613f","observation_id":"010bf48e-4ce5-44fe-a456-0a2d80a7dd25","resolution":{"observed_at":"2026-08-07T20:25:59.200014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T20:25:58.486806Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.486806Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:0c6bbd5e15793601e2d464d45c58e10cb45396290321079e81094e6256c9fb6b","observation_id":"2394962e-aa9d-4613-86c3-49bfbe126f3e","resolution":{"observed_at":"2026-08-07T20:25:58.486806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.170576Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"8918f4d9-45ed-41ee-bb96-104382da9f7d","year":2022},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.493078Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:35e8308c71a42333e43423a5daab7b4a3f461019c05cd5125025786d07ccf9f9","observation_id":"38ffbaa5-1e8d-4562-aeaa-3b5fac7cd4cd","resolution":{"observed_at":"2026-08-07T20:25:59.177301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.151531Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":"4d46be5a-2d7f-492c-8252-fc9a3afa7032","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.498077Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:7596a635ce2cfa4740c56636dd619f97feda7b7a08cb9c5c4dd3a806e37347b6","observation_id":"cd7b49c2-a6e2-43bb-9766-1022caeef332","resolution":{"observed_at":"2026-08-07T20:25:59.157478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.130940Z","title":"Understanding zero-shot adversarial robust- ness for large-scale models","venue":null,"work_id":"8eae521e-0cea-4a86-8683-a66690b27d11","year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.503335Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:63f2281f3cd0ae6d9a72153c6a999c2ab0ca5003066231c4280736bebfaae0c5","observation_id":"06812f5e-2460-458d-828b-3204904a853d","resolution":{"observed_at":"2026-08-07T20:25:59.136750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.508674Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.508674Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:69c5eaf69f9d0bb1ad22ca7f237e5f62ba945471cef22c5067f02e40a8c96f4c","observation_id":"3b5c2d96-6aef-4ffc-a56e-fd306bc2d6c2","resolution":{"observed_at":"2026-08-07T20:25:58.508674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.095209Z","title":"Gpt-3.5 turbo","venue":null,"work_id":"c9c32605-3534-4543-bc34-190392febdb0","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.514303Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:1c9a755a44361392815289d3bec989d15f83bfa095a1d4e072682533588f85a4","observation_id":"cc9d91b8-b302-4cf8-aba5-62fb66f13ecf","resolution":{"observed_at":"2026-08-07T20:25:59.102629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.074637Z","title":"Are nlp models really able to solve simple math word problems? In NAACL-HLT, 2021","venue":null,"work_id":"239c4452-02fa-4f01-a668-6d22c4de105d","year":2021},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.519582Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:b2aca9d2f4b0a26364174b755a32c147287f3b6afeaf33a938ca15233bc1db00","observation_id":"403be801-f927-4acd-b089-efe41a4ba526","resolution":{"observed_at":"2026-08-07T20:25:59.081273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.054551Z","title":"Homepage","venue":null,"work_id":"b5f9e77c-ef9d-42c9-845c-fdc2e356d2fc","year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.525855Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:1a9899ffc33d4a0e66c97ffa29a0319639559152b3873a1e0e2b889774b20387","observation_id":"b32d299b-6207-43d8-96f0-8fead312d049","resolution":{"observed_at":"2026-08-07T20:25:59.061065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.000951Z","title":"Visual adversarial examples jailbreak aligned large language models","venue":null,"work_id":"f47ef2f4-7c35-41c2-a1bc-8980d65cd88c","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.539490Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:411918a5bbd6d50b9e3b461d025e809579afc687c23608188728c911a8e14204","observation_id":"3439da96-30d7-4e0b-b9f1-8b278ed8d560","resolution":{"observed_at":"2026-08-07T20:25:59.008222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.980667Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer","venue":null,"work_id":"08e85d2a-ce6f-4540-a6ee-66559e157e30","year":2022},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.545301Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:e1592ef029470c463bd569ee5e38a8e20abdc9140ef69df67db22995cabfa7b4","observation_id":"f6299b28-b9e6-4049-91a2-2ea929020757","resolution":{"observed_at":"2026-08-07T20:25:58.986614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.961877Z","title":"On the adversarial robustness of multi-modal foundation models, 2023","venue":null,"work_id":"3a135ef7-184e-436e-955e-f05eeb5cd9ec","year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.550995Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:4bcabafb1f2d2daa1081960548c03122bfa634e8a78837fb00e2a0eb8332eda6","observation_id":"a5ce974a-f315-43a0-a3e6-d0e34f3137da","resolution":{"observed_at":"2026-08-07T20:25:58.967524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.942639Z","title":"Robust clip: Unsupervised ad- versarial fine-tuning of vision embeddings for robust large vision-language models","venue":null,"work_id":"732b31f4-4c2a-4c44-a37e-3ddad0d33e2a","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.556555Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:a6f3f5997292bf8678c412255ac5e23b277ce189bd4b5a46990242f4012c42fe","observation_id":"f81d975d-aed2-4629-8323-c292deccde64","resolution":{"observed_at":"2026-08-07T20:25:58.948610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.921886Z","title":"Large language models can be easily distracted by irrelevant context, 2023","venue":null,"work_id":"783b6b07-bae4-4c89-8fc4-2f4334035cca","year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.562026Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:f32cf1291c76f90287ce06db94e1f681165cb213133b0f8f9ce61f3b8023f66f","observation_id":"87b13a6c-1f33-46f3-b4c0-dc1caf2df972","resolution":{"observed_at":"2026-08-07T20:25:58.928046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.902613Z","title":"Towards vqa models that can read","venue":null,"work_id":"abfdd892-b948-420a-aab9-19f82eb572e5","year":2019},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.568109Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:ac2bf774a1e931e4bd7f93513cd632c85207aa615246a4dacfe6f54b78ad3106","observation_id":"4a016203-6941-4686-b224-43f566834c56","resolution":{"observed_at":"2026-08-07T20:25:58.908306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.883514Z","title":"Unsplash api","venue":null,"work_id":"7f8e852f-2305-4d63-aab2-7a8933ab7b7d","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.573558Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:f6ddae432e3bcdd8564c23359f72b50e473b1cf56a87027c96f546dada614c47","observation_id":"a31188e5-e4eb-4d69-bb43-306c9759323f","resolution":{"observed_at":"2026-08-07T20:25:58.889018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.864305Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":"fd2b86f8-9b44-419b-8524-7a7ed43b335c","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.580371Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:9cc6f3179d5c05ce0e43c1bd35f562e94c30e91ed9ee4dd47ab79f46409679f3","observation_id":"88d427a4-54cc-4ea6-92a4-42de4e6d29f4","resolution":{"observed_at":"2026-08-07T20:25:58.870325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T20:25:58.585610Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.585610Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:bd459880398e9faab87ad39923fcdfe77eb86ffde96d7afa8c7144dfb288da30","observation_id":"511b0599-cc63-4731-94ce-6bdcecf8d2ce","resolution":{"observed_at":"2026-08-07T20:25:58.585610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.840267Z","title":"On evaluating ad- versarial robustness of large vision-language models, 2023","venue":null,"work_id":"9440ab95-1e46-4f75-90e9-cd38fa1aa028","year":2023},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.591386Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:5b24d91f17682b9bda273930d8cd08dbfbcc364525abfde85e66c2f97a611f53","observation_id":"c0365983-3f1b-44a0-9ff2-b663f50f370d","resolution":{"observed_at":"2026-08-07T20:25:58.851745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:58.819550Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":"3ad40c9e-ae32-4394-b7a5-5a294eda928c","year":2024},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.596793Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:d3d8e963735012481d9537c2cd43513742483eaa101ca106203c75f586cf1fd1","observation_id":"02225cbf-15c6-4914-b4b6-8fdb52c6be58","resolution":{"observed_at":"2026-08-07T20:25:58.827053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:25:59.033603Z","title":null,"venue":null,"work_id":"838df9a8-33f2-40c1-90f7-85f0280ebef5","year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.533546Z"},"links":{"citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:f35cfe62fc5e58d02d6acec4c1f56e881b9f47f8c50ef40e1b435e7dcb78d49a","observation_id":"f4d9cd83-44e4-40e9-bdf3-23e12f2c026c","resolution":{"observed_at":"2026-08-07T20:25:59.041438Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:20:21.749513Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":13,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2502.09818."}