{"as_of":"2026-08-08T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a2b2aeba38065331a1efec2ebd026c168576fafa1bed60af1a533afe49a4eaa","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:57.959423Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:44:03.224842Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:56.636833Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-07-03T20:18:56.636833Z","title":"Bench- marking multimodal knowledge conflict for large multimodal models.ArXiv, abs/2505.19509","venue":null,"work_id":"4fec24e9-06d4-4c9e-8268-76f2c9610a2b","year":2025},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:f2306cce831ab2f85b0782cb698c33acd89e040f0065c61e03e65e0a133040e1","observation_id":"e0494347-3837-40a3-95e8-2e0c2420a272","resolution":{"observed_at":"2026-05-14T20:59:27.451890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-07-03T20:18:56.636833Z","title":"Bench- marking multimodal knowledge conflict for large multimodal models.ArXiv, abs/2505.19509","venue":null,"work_id":"4fec24e9-06d4-4c9e-8268-76f2c9610a2b","year":2025},"citing_paper":{"arxiv_id":"2605.15710","last_updated":"2026-05-15T08:00:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-15T08:00:46Z","title":"SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T19:11:15.761831Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2605.15710"},"observation_digest":"sha256:7586f79c965ddd99713f675eadf25731ce8e141af8deefa02943b3f979893db8","observation_id":"b7ebd128-f15e-420e-a573-22f0002f653e","resolution":{"observed_at":"2026-05-20T19:13:40.530116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-07-03T20:18:56.636833Z","title":"Bench- marking multimodal knowledge conflict for large multimodal models.ArXiv, abs/2505.19509","venue":null,"work_id":"4fec24e9-06d4-4c9e-8268-76f2c9610a2b","year":2025},"citing_paper":{"arxiv_id":"2606.17953","last_updated":"2026-06-16T14:05:46Z","snapshot_observed_at":"2026-08-08T03:30:33.979416Z","submitted_at":"2026-06-16T14:05:46Z","title":"MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T01:28:50.021432Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2606.17953"},"observation_digest":"sha256:6d41c7864ea7d3493f99b322018b56e4759b54269f003f34afdf05219ab996ca","observation_id":"fb9280d8-94ae-424a-af30-83d8e846645c","resolution":{"observed_at":"2026-07-03T20:18:56.638205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-08-01T14:44:03.224842Z","title":"Benchmarking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18673","last_updated":"2026-08-03T23:44:52Z","snapshot_observed_at":"2026-08-07T23:09:34.423169Z","submitted_at":"2026-07-21T03:43:50Z","title":"MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T14:44:03.224842Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2607.18673"},"observation_digest":"sha256:71bd57c5a0dcfcdbaf685f5805632f1973ae6e3ac1f446f09631481540dba18b","observation_id":"347d6381-151a-4498-ba4c-25dcf1bfd55d","resolution":{"observed_at":"2026-08-01T14:44:03.224842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19509/citation-record","integrity":"/paper/2505.19509/integrity","json":"/paper/2505.19509/citation-record.json","paper":"/paper/2505.19509"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:16:53.288144Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.288144Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:f14a58ae96c4c255bed6f3a540f2d4e0bb97b24d36ff4808282feff122d4ed73","observation_id":"4e1c7e12-f576-49fe-928c-0489a0730825","resolution":{"observed_at":"2026-08-07T14:16:53.288144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:53.350846Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.350846Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:56fefc392ff9ef8a09c493f339d4bb7215d39be37b749801d664c78483d03f85","observation_id":"c7d0d6ff-3ce7-4146-b9be-5c195a1575eb","resolution":{"observed_at":"2026-08-07T14:16:53.350846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:53.441172Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.441172Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:fd2ee328c56b3ff8483557f2e8f8ef3435e9d420d136032a6b8be383317def4d","observation_id":"01e2cd52-62e3-49de-a71d-611d17d70005","resolution":{"observed_at":"2026-08-07T14:16:53.441172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:53.549192Z","title":"A survey on multimodal large language models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.549192Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:1377163b993d6b6d2a71e74966c1fd12239a6b4369020653944b7d7bfa4eb0fe","observation_id":"6ce1d9ad-58e1-4044-8633-28878cd28bbd","resolution":{"observed_at":"2026-08-07T14:16:53.549192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-07T14:16:53.615102Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning.arXiv preprint arXiv:2505.08617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.615102Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:d5649ea573567d1852f59b2b27859f4756acb53c320feead8c49be0a3f51b848","observation_id":"a30c6368-55f9-42b7-bf76-ecec9cfd96a7","resolution":{"observed_at":"2026-08-07T14:16:53.615102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:02.389454Z","title":"A survey on rag meeting llms: Towards retrieval-augmented large language models","venue":null,"work_id":"85d39458-8e72-4d47-91f9-89771627ecdb","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.708183Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:4321340ddeb8d5ab092c53e46ae3589eb164e82762815a74b512a4f81a01b0df","observation_id":"0d6df923-6e61-417e-a95a-3d6f81846ea3","resolution":{"observed_at":"2026-08-07T14:17:02.460446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T14:16:53.793245Z","title":"A survey of multimodal retrieval- augmented generation.arXiv preprint arXiv:2504.08748, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.793245Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:f21655ef45dd1a16a178a3e38cc1645eda41a64fe98c29d75820a807bc700ce6","observation_id":"fd11a890-692d-48c2-8917-d8f7d020f9f6","resolution":{"observed_at":"2026-08-07T14:16:53.793245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:02.237448Z","title":"Knowledge conflicts for llms: A survey.EMNLP, 2024","venue":null,"work_id":"096a5b65-bfd1-46a6-ac78-0c0bd6f69977","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.861819Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:c4f4f8b565d73bf9c7033c07ac4a1953cb750832fb2d53ceddd2fb74249427da","observation_id":"1abeb804-e43d-4b96-b67e-e51415a2d6ea","resolution":{"observed_at":"2026-08-07T14:17:02.307981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:02.058779Z","title":"Resolving knowledge conflicts in large language models.COLM, 2024","venue":null,"work_id":"99fa7c96-c93f-4838-9544-9af0efd7d6ec","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.949372Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:f99140bfecd0c41ad0311adc588042a26f8d5217823cce95fa6d9b32bcd47bfb","observation_id":"7a882889-cb12-4607-a26d-bf276bd25c56","resolution":{"observed_at":"2026-08-07T14:17:02.164448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.832062Z","title":"Wikicontradict: A benchmark for evaluating llms on real-world knowledge conflicts from wikipedia.Advances in Neural Information Processing Systems, 37:109701–109747, 2024","venue":null,"work_id":"754c133b-c494-4763-9e77-9555f814f5e0","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.079887Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:7b78a6a0a213c8623cfd2521f2eaf82f1c20790db572b8074cf08de99181b746","observation_id":"f9b0a995-b122-4deb-b3aa-6f5765ad6c21","resolution":{"observed_at":"2026-08-07T14:17:01.966896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.649066Z","title":"Conflictbank: A benchmark for evaluating the influence of knowledge conflicts in llms.Advances in Neural Information Processing Systems, 37:103242–103268, 2024","venue":null,"work_id":"0c21b7a3-2cae-4cc0-9f76-6ae0499cd2c3","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.208218Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:e21128166150d542b223a1350791f639fdf2b32eae4806ab5c4fa38f7eb2b9a5","observation_id":"eb578382-2152-45a7-ba50-f6d9d28163c6","resolution":{"observed_at":"2026-08-07T14:17:01.727966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08145","last_updated":"2025-05-31T02:59:15Z","snapshot_observed_at":"2026-07-06T19:31:18.802964Z","submitted_at":"2024-10-10T17:31:17Z","title":"Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08145","snapshot_observed_at":"2026-08-07T14:16:54.402819Z","title":"Insight over sight? exploring the vision-knowledge conflicts in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.402819Z"},"links":{"cited_paper":"/paper/2410.08145","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:4da8be5321418b4c46f6fe66d8473bc496f3103c2908c79a33418c2a043d0895","observation_id":"c4524538-a42c-4eaf-a5f5-b89e1770a19e","resolution":{"observed_at":"2026-08-07T14:16:54.402819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.07722","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:58.335748Z","title":"Is cognition consistent with perception? assessing and mitigating multimodal knowledge conflicts in document understanding.arXiv preprint arXiv:2411.07722, 2024","venue":null,"work_id":"8290a953-2272-4241-a043-53a682b8fb3a","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.522026Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:19f6f5f7e538f5b91506f78380b55ebb737026e72c54d7edb2ce11bb826b8e7b","observation_id":"f410f9fe-3937-4dc7-8003-7f2c35e5bad2","resolution":{"observed_at":"2026-08-07T14:16:58.384722Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03659","last_updated":"2024-10-11T15:07:31Z","snapshot_observed_at":"2026-08-05T12:32:26.990966Z","submitted_at":"2024-10-04T17:59:28Z","title":"Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03659","snapshot_observed_at":"2026-08-07T14:16:54.646826Z","title":"Unraveling cross-modality knowledge conflicts in large vision-language models.arXiv preprint arXiv:2410.03659, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.646826Z"},"links":{"cited_paper":"/paper/2410.03659","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:3bb56c85f293d53bbb6401eb490e8831e2e35e54df93b78b4b1366f38a3b8f82","observation_id":"7dc98abf-b225-4c39-85c8-175ef4573d84","resolution":{"observed_at":"2026-08-07T14:16:54.646826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:16:54.741327Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.741327Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:d95d54584265c0bd2cf677cf32233e504eeab44d920cd60ad417cafef6c6772a","observation_id":"68370baa-f6fd-4626-9c4e-34af8b7f9cf4","resolution":{"observed_at":"2026-08-07T14:16:54.741327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:16:54.993984Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.993984Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:50912a2d0778e1430f34966b96f5d01039e0408d65a04dc3d36459d74f46f96c","observation_id":"6749619a-c194-47f3-8b9b-00d6631ff043","resolution":{"observed_at":"2026-08-07T14:16:54.993984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.430320Z","title":"The revolution of multimodal large language models: a survey.ACL, 2024","venue":null,"work_id":"adc62bba-5a23-4f51-b779-9066101f021f","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.112996Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:d80ae6504d20a1105df44c7cd541cac987e986fe208cb0068377201e6ba65b72","observation_id":"6a175781-5712-4812-be12-c32901234b7d","resolution":{"observed_at":"2026-08-07T14:17:01.534360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:16:55.202229Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.202229Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:cfa88493be341feca0226aa824fa7661cff2cae76c852f0a950ca798add50fe8","observation_id":"418f979b-fd5d-4873-8ba0-8985a042e48a","resolution":{"observed_at":"2026-08-07T14:16:55.202229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:16:55.285949Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.285949Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:1098778645fc4d49490e8971cd2c27de44b046128861278e44ec540ae634193d","observation_id":"640f1b77-a3ce-4e31-bd86-e1288a213f49","resolution":{"observed_at":"2026-08-07T14:16:55.285949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:16:55.402884Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.402884Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:71a13420a0ae2e51399b83dcc75d046679b0b07ce81808ec2345fa846f1caf65","observation_id":"074984d8-e329-4f96-8f3a-31afca65b5f1","resolution":{"observed_at":"2026-08-07T14:16:55.402884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.277132Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.ICLR, 2020","venue":null,"work_id":"3e703ac0-c88d-4305-b404-431b75c903bf","year":2020},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.510436Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:be1c4b0b018202cc7a22a53bfdb094c690416b877bcdb2512bb7a4ca8b8fc983","observation_id":"9ed7f2ed-829b-4a71-a792-08ec5e6737f0","resolution":{"observed_at":"2026-08-07T14:17:01.372686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:16:55.605857Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.605857Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:01eed5a676d54d8946169bd6441f428b097b84a2adfd24be885900bbaa34a789","observation_id":"3c97a7b7-3b6a-40a8-959d-3a065bd0e19d","resolution":{"observed_at":"2026-08-07T14:16:55.605857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.098110Z","title":"Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"ac681064-d360-4873-9788-858bb19fcb2e","year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.729330Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:79dae339cf23b8dcb0903175ee99af86027c0a1ac6fca2d259bea5ea9ab44097","observation_id":"d8320f76-a640-4a05-a88d-a8a974895333","resolution":{"observed_at":"2026-08-07T14:17:01.190238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.889387Z","title":"Mllm-compbench: A comparative reasoning bench- mark for multimodal llms.Advances in Neural Information Processing Systems, 37:28798– 28827, 2024","venue":null,"work_id":"02a201e6-87f0-4322-afcb-3bd4a74418a1","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.839934Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:fe7368ac8c0dbefd56148e653c6fb8264aff8c53f668b3fdf7fa06a5324b24eb","observation_id":"4cbcf3c7-bab1-41db-9043-3fa99e70af8e","resolution":{"observed_at":"2026-08-07T14:17:00.983963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15769","last_updated":"2024-08-28T13:05:55Z","snapshot_observed_at":"2026-08-06T13:29:37.152582Z","submitted_at":"2024-08-28T13:05:55Z","title":"A Survey on Evaluation of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15769","snapshot_observed_at":"2026-08-07T14:16:55.906329Z","title":"A survey on evaluation of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.906329Z"},"links":{"cited_paper":"/paper/2408.15769","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:073bc74020874fda7b548870063cb39de3a0e2125ba6381369bb36f0ecf24461","observation_id":"6023184c-710a-4066-a4cb-332ab1951308","resolution":{"observed_at":"2026-08-07T14:16:55.906329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.694747Z","title":"Clova: A closed-loop visual assistant with tool usage and update","venue":null,"work_id":"540bdfce-e295-4432-872f-04876cefe22c","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.030622Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:c4acf9be85876bdd44901706af70f3612c2ebe1de10fdf6fe307ca54e09ec079","observation_id":"5f522402-95a2-4abd-84f4-6a0f8e974221","resolution":{"observed_at":"2026-08-07T14:17:00.801917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:56.224366Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.224366Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:c85704bd11e0713df5ae1e910d029bda005e88ca9c5af296ea39501efdcb12c4","observation_id":"46fea237-d177-49f6-92a6-231bbbe5c8fd","resolution":{"observed_at":"2026-08-07T14:16:56.224366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:56.423955Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.423955Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:1ab9352e7a761f0abe2b253deca71db73b8da1f72b60437dbb12088249a99ca6","observation_id":"c03cfc87-1ddf-41f5-9148-c88a0d459eb2","resolution":{"observed_at":"2026-08-07T14:16:56.423955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.508154Z","title":"Rich knowledge sources bring complex knowledge conflicts: Recalibrating models to reflect conflicting evidence.EMNLP, 2022","venue":null,"work_id":"3e7402de-5952-44c9-b70d-571c4e18f575","year":2022},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.591250Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:263aa3f94eb7add626f575f22d839d736ba225ae39399b0174b83abde4a0418d","observation_id":"701a6a19-afcd-4f82-8bde-d80c358e148b","resolution":{"observed_at":"2026-08-07T14:17:00.603329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.320437Z","title":"Adaptive chameleon or stubborn sloth: Revealing the behavior of large language models in knowledge conflicts","venue":null,"work_id":"c5128e2a-8d96-4218-99bd-e1029fde9eb1","year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.746881Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:ebd31a9e108d163f63afd013af9d60fe18be27560ccb843b5a1ec4d1e5f84220","observation_id":"4e8ac675-fa4b-48ea-be94-5f805b46bef7","resolution":{"observed_at":"2026-08-07T14:17:00.379877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.177419Z","title":"Entity-based knowledge conflicts in question answering.EMNLP, 2021","venue":null,"work_id":"20fe6baa-e014-4cc6-bf3a-561385f6def9","year":2021},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.875035Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:ed88e1f49404f95a58da9fd324ce84c8f3eb3266eb7dec7916ca13cc76470151","observation_id":"bda3af74-c18b-47e6-acfa-e8f78e5d8e53","resolution":{"observed_at":"2026-08-07T14:17:00.246356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.994822Z","title":"Intuitive or dependent? investigating llms’ behavior style to conflicting prompts.ACL, 2024","venue":null,"work_id":"8467390e-9de3-42c2-ad28-b1de636172cb","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.035272Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:51300764cc31d856a81ce8da65320bf297b7f6a40496edc5742ce0ac3520140c","observation_id":"7a0b5327-cdfb-4fb7-85b1-7026bacd9e34","resolution":{"observed_at":"2026-08-07T14:17:00.107246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.807832Z","title":"Contradoc: understanding self-contradictions in documents with large language models.NAACL, 2024","venue":null,"work_id":"5f5d0b6a-4378-4ee8-a21c-355f61166ec0","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.190240Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:ea9c559c9fe20b6e4c535221b5560d6a002a1b8bc7f1394fc33cecf8877a7f13","observation_id":"148ff244-7622-40ea-93f2-c5954bfc14c6","resolution":{"observed_at":"2026-08-07T14:16:59.880833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.595008Z","title":"Trueteacher: Learning factual consistency evaluation with large language models.EMNLP, 2023","venue":null,"work_id":"eaed1532-471e-49a0-b2ca-9a5262dd370a","year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.321271Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:7ebaabc4fd19152b72d87c801a31db5504fb22c68d7e4aec500272b97a4e5452","observation_id":"6fce640f-37fb-467f-9f3b-331e5fe59ff8","resolution":{"observed_at":"2026-08-07T14:16:59.711402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.361087Z","title":"Dola: Decoding by contrasting layers improves factuality in large language models.ICLR, 2024","venue":null,"work_id":"acc2ef00-b331-4e92-8bb1-c399611fe945","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.514451Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:cee128d7bae010f5a932b26b1e634368ae90134264abb34b5c7ccc56feae58c9","observation_id":"92998a26-1d0b-48b4-8ae5-9d148cdc3d63","resolution":{"observed_at":"2026-08-07T14:16:59.473399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.155903Z","title":"Factllama: Optimizing instruction-following language models with external knowledge for automated fact-checking","venue":null,"work_id":"bde701e3-e0e1-4196-b77c-07ef57478e04","year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.684465Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:479960b73dad8186e2b7c57f2468fc0194b451385d3c8621e8bdde6c83e2e383","observation_id":"53d8985e-9f17-4987-bcb7-f1febcae1b50","resolution":{"observed_at":"2026-08-07T14:16:59.254826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:58.834896Z","title":"Mmke- bench: A multimodal editing benchmark for diverse visual knowledge.ICLR, 2025","venue":null,"work_id":"3dcf3538-9942-46e1-8e7e-174faeb51d75","year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.810863Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:c60f50691d4f4400fd9556a7e6cf5321cc372f1791e0710677036103a9e7985c","observation_id":"51653bb8-82f3-4510-8221-cc1cd0aa7b03","resolution":{"observed_at":"2026-08-07T14:16:59.015749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:58.562611Z","title":"happy\" with","venue":null,"work_id":"f4015c1e-5c4e-4ec4-a6b6-8c3db97f139f","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.959423Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:d20438a506cc0eecf19e5196162aa720de3d1e9d2faea0781b0ea60b892dfdb4","observation_id":"25cd1c30-bbc1-4744-bcdf-4bdf4ab8217b","resolution":{"observed_at":"2026-08-07T14:16:58.669013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:10:29.240347Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 4 inbound Pith citation observations for arXiv:2505.19509."}