{"as_of":"2026-08-06T18:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:973f7b91bcee7165372107d6da84a63a1ce8c3ba8c8ae0cb4d637c55fefc9c3d","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T23:52:13.813452Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:46:24.074055Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T00:46:24.164407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.08923","snapshot_observed_at":"2026-08-03T00:55:26.402402Z","title":"Same content, different answers: Cross-modal inconsistency in mllms.arXiv preprint arXiv:2512.08923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-05T23:11:21.852765Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.402402Z"},"links":{"cited_paper":"/paper/2512.08923","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:48856da36c6b589b6d234bc87ab2385236efeb0474e6c8654f9e00dab11b82dc","observation_id":"c707c0d3-f389-4d8f-8197-e927dbff2e72","resolution":{"observed_at":"2026-08-03T00:55:26.402402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"cited_work":{"arxiv_id":"2512.08923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.08923","snapshot_observed_at":"2026-08-05T00:46:24.164407Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","venue":"cs.AI","work_id":"4ba9f525-7d08-4b41-bf73-8dca6f298171","year":2025},"citing_paper":{"arxiv_id":"2608.00561","last_updated":"2026-08-01T09:54:54Z","snapshot_observed_at":"2026-08-06T18:23:04.717686Z","submitted_at":"2026-08-01T09:54:54Z","title":"Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T00:46:24.074055Z"},"links":{"cited_paper":"/paper/2512.08923","citing_paper":"/paper/2608.00561"},"observation_digest":"sha256:af7f5aad8524a8c171214494b787295b691a008d03666d1213d5f4e94a1673a8","observation_id":"b17d3675-72d1-4890-90cb-bf5c3a2a02df","resolution":{"observed_at":"2026-08-05T00:46:24.168279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.08923/citation-record","integrity":"/paper/2512.08923/integrity","json":"/paper/2512.08923/citation-record.json","paper":"/paper/2512.08923"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:158c4b63e6d6100e759c38b314ff7d9b41968c365f2c295987e6e46cbdcb1ac6","observation_id":"8110ebdf-c7d2-484e-9085-aa3bab10f518","resolution":{"observed_at":"2026-05-16T23:53:42.823660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":"2412.08905","doi":"10.48550/arxiv.2412.08905","metadata_source":"pith","pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-4 Technical Report","venue":"cs.CL","work_id":"b6274271-7af9-4ee8-993b-ba1ba4205ba8","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:96b650db04cf30c1df6998b0c097bd540383063bafb2639cf12c2bbdb60f925a","observation_id":"dbd07447-2ccc-46d0-8aa9-74421aaa251e","resolution":{"observed_at":"2026-05-16T23:53:42.806385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:4b611eefca077c41ab8d137c8956f032e9c323531f62e043b7e13d61fc372adf","observation_id":"629b82f1-6678-4283-88aa-6f857f9fd5d9","resolution":{"observed_at":"2026-05-16T23:53:42.801800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736","venue":null,"work_id":"39acf795-5cf8-436e-9263-403289f4a06c","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:31116a5f8693e624c840f2df27e2af751db091a7289fb5227609b1dfc76949fa","observation_id":"6d08b4ea-d40d-40ad-b6fc-47877c3b6597","resolution":{"observed_at":"2026-05-16T23:53:43.689256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03854","last_updated":"2025-05-30T13:04:40Z","snapshot_observed_at":"2026-07-06T20:47:28.072925Z","submitted_at":"2025-03-05T19:36:43Z","title":"Vision-Language Models Struggle to Align Entities across Modalities","version":2},"cited_work":{"arxiv_id":"2503.03854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03854","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-language models struggle to align entities across modalities","venue":null,"work_id":"5c9f55ac-83c2-4144-83b5-997c68f45013","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2503.03854","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:1aa77e152fb4a5dcab07cadc217cfdedf2918c6358a1394a07d374056a8a4db3","observation_id":"82fd1ed4-f002-4700-bb0b-9d9a2288c4ea","resolution":{"observed_at":"2026-05-16T23:53:42.846348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude haiku 4.5.https : / / www","venue":null,"work_id":"2569b63a-d413-487d-b8dd-6198befff280","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:d057f9a615610b7d11309e6dc721f9d902609017b54f4063f69b8f2be816217f","observation_id":"9ec85214-d38a-4720-8d5f-89e6031c39db","resolution":{"observed_at":"2026-05-16T23:53:43.680031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:9d9fe1e92b8caf6adbe65e6e715a82de1c1f1bd94a1984609fcf45dffea6f55e","observation_id":"a032a83c-12d9-41c7-a11c-72323f28eaee","resolution":{"observed_at":"2026-05-16T23:53:42.870999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12219","last_updated":"2024-10-16T04:29:46Z","snapshot_observed_at":"2026-07-06T19:34:18.918585Z","submitted_at":"2024-10-16T04:29:46Z","title":"OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities","version":1},"cited_work":{"arxiv_id":"2410.12219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12219","snapshot_observed_at":"2026-07-01T23:06:21.381526Z","title":"Omnixr: Evaluating omni-modality language models on reasoning across modal- ities","venue":null,"work_id":"ccdbb47d-a108-43e7-98dc-db3769fb9b31","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2410.12219","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:fd5189ddd5c4802a13320392800f5c8acf22d3a665763a44090508899fbcfcf8","observation_id":"e10d9367-0423-4a63-9e85-fb27745fe9c2","resolution":{"observed_at":"2026-05-16T23:53:42.853563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:21730101f6b8acc4df9140df583e8ad52694dc33a7adad2b5813bbae86f56f20","observation_id":"c74bdb3d-134f-4358-a7fe-9ec764820783","resolution":{"observed_at":"2026-05-16T23:53:42.849602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"9ad73fa7-51e9-42b4-ae1d-822bea7d07cc","year":2023},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:90822a3e4f04207770844deb5dbdc299abb7c3016061eb6f42214dde4eeafdcb","observation_id":"9fd7b350-d676-42e6-97f5-e846835ed321","resolution":{"observed_at":"2026-05-16T23:53:43.790193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"4753da2f-9b32-4de1-b019-c909d3862622","year":2009},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:1315bfd098734d9b21d7d3233dc1f2cb27e7fbb99db54da4fe69284030777092","observation_id":"bb41fc09-05d4-4189-ae06-247272359f38","resolution":{"observed_at":"2026-05-16T23:53:43.779247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigate the gap: In- vestigating approaches for improving cross-modal alignment in clip","venue":null,"work_id":"dbe74c6b-f504-4cc9-a2e8-0bac07336a62","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:148746f88a4f806afc47abd219a9d2f1ec0813a57ae98064260b3d4f5d3a3c40","observation_id":"04488c18-9fbe-4051-a41e-7d9cb246797c","resolution":{"observed_at":"2026-05-16T23:53:43.783049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"8b1993b4-6139-4e0f-ac08-6c6e564cf454","year":2017},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:33ccff850b4e5c5465400341e4e87ba825224ed082a644d12f0255db7681385c","observation_id":"b66000c2-f3a1-4559-a26c-e897629f440e","resolution":{"observed_at":"2026-05-16T23:53:43.786978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:9d74dc2c657e68b734eace71b69d4616ef7c002f1ece09768b534943865605be","observation_id":"c41ac8c6-9930-4b05-b1c8-a82d8499863a","resolution":{"observed_at":"2026-05-16T23:53:42.867680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"423c9e41-284f-46ab-b5c4-f08bd2847fef","year":2019},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:7efba582034c3f67e373b22eb8518ca8c50599b33df8872fc4e8987e835f6fd7","observation_id":"dc49d84c-e77d-4ca1-aa50-02ac446c14f8","resolution":{"observed_at":"2026-05-16T23:53:43.793654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:d484eea0dddef4e7aaa41b82aecc166afbb31147f4c608101e9dd5c26ec7a6b5","observation_id":"d54af141-9264-4dcd-9f07-babb89050309","resolution":{"observed_at":"2026-05-16T23:53:42.856747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"f5eb1c69-e1a8-4da2-8a56-450f65e1fc43","year":2023},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:5a1ebe0073bda50d76d6e3b8bc9329a2d2ba65e94f5dcdf896eecd09f4447215","observation_id":"2791da44-24dd-4661-a9f7-10b0f6fbfd46","resolution":{"observed_at":"2026-05-16T23:53:43.774116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Sys- tems, 35:17612–17625","venue":null,"work_id":"6d69135c-afd1-4119-9a91-e0517b87bd5b","year":2022},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:8d467bc9eb5cb84619ff3dfb55fb7ee5f7e1dfeb41e9dd4e2ca37da298860858","observation_id":"731d9b5f-7839-4f7e-8515-90899bb1b679","resolution":{"observed_at":"2026-05-16T23:53:43.765623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"80df3d4a-379c-485b-991a-704ad587d79c","year":2023},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:d0e433f9a66d0c05918319a1a2e8391ef3d75f06f92d37c06729d16ae1b7bd56","observation_id":"b1db986c-ea88-4467-894c-9afd7736f253","resolution":{"observed_at":"2026-05-16T23:53:43.769727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"57509b1b-60b7-4229-9775-c0c307e59451","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:9e8f629c931e2b61f4d3922290a12978f9914da6614e68af4502b0e53b54c406","observation_id":"62d9f306-c088-4f27-91fc-b3923ce4fd38","resolution":{"observed_at":"2026-05-16T23:53:43.753682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:7e6ccf33c57c6aa85d936a735c32b422b14d91e6f3626617211dd95e85cd845e","observation_id":"b6178d22-fd8e-45bb-b607-186af747abe3","resolution":{"observed_at":"2026-05-16T23:53:42.815533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:6418312f298c589578c3e21969f0d405328286095c3cd1c664f35c51d6fd13b8","observation_id":"aa6a5384-6833-4f69-857d-98ce2052ccac","resolution":{"observed_at":"2026-05-16T23:53:42.835334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning","venue":null,"work_id":"18262ec2-363b-4c49-98a8-6fc5e11d21cc","year":2022},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:dff6437ead39db9842f1b1a65215b5961952a8a1609efe9de09150e3a6129bc7","observation_id":"85b3e2d9-801d-4184-863f-19dc87ade8b0","resolution":{"observed_at":"2026-05-16T23:53:43.748547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"c4f959b8-207d-4dcd-83d1-305945d95f42","year":2021},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:4b8334df833bed63a104de73be1511ec89e93acd8dc61a0d6a0bac419c1c6d20","observation_id":"8dd87484-e0cd-4ec2-89d8-c410751296e7","resolution":{"observed_at":"2026-05-16T23:53:43.757062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.05229","doi":"10.48550/arxiv.2410.05229","metadata_source":"pith","pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","venue":"cs.LG","work_id":"7d26909d-cb69-48f7-b93e-7d6fcc281415","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:5af1c77e31973d0cbbbdbd59bcb647e01b82079f53ba9b89b74ba8afd49dc849","observation_id":"93f68678-e4ad-493c-9245-c3aedf3d2aa3","resolution":{"observed_at":"2026-05-16T23:53:42.827500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-18T18:51:19.596854+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T18:51:19.596854+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mistral-small-3.1-24b-instruct.https:// huggingface.co/mistralai/Mistral- Small- 3.1-24B-Instruct-2503","venue":null,"work_id":"5f9dc01c-15e3-450d-89cb-51d2570f584f","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:9c23f8cd6953f420223aac9a064f4487d8be2d170899c3c4ee3d61c516d4d926","observation_id":"ce62c00c-a3b6-4228-ad23-c9ccc56b3db7","resolution":{"observed_at":"2026-05-16T23:53:43.761259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-5 mini.https://openai.com","venue":null,"work_id":"066fa087-41f0-49b4-98d1-0172a63248ff","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:6db388ad318e37ee8e14ba8a68692c829d764e136af2b0200f0e41c2f5cf52c7","observation_id":"197a3225-651a-47ab-bb69-71a1647c11b1","resolution":{"observed_at":"2026-05-16T23:53:43.737507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kakade, and Stephanie Gil","venue":null,"work_id":"426596be-4fc7-491e-8933-6865b67596c6","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:11d356eae24786a82e89776a914cbd950e4359f6371b47ac8e5f14f4e188f9b6","observation_id":"a0f24f34-b1f2-4247-ae93-73c32ff85795","resolution":{"observed_at":"2026-05-16T23:53:43.740729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"6a98d6cc-2ddb-45a7-918a-a6294b9f2253","year":2021},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:2d635e77dc52db069ba64004f6c58d08990535616394b5c2707f8d749829d559","observation_id":"196592b0-8581-4318-80dd-f6c9647a0572","resolution":{"observed_at":"2026-05-16T23:53:43.743674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Privacy-aware visual language models.arXiv e-prints, pages arXiv–2405","venue":null,"work_id":"17a7b2dd-c006-42cb-82e9-bbcaeca09fc2","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:728bc8b9a65e0a5ad43b778233f5e9863518e9bcdb6a8c4a80b59c12c604cf32","observation_id":"d86cdffc-8199-47d3-95ca-41dc8fb298b5","resolution":{"observed_at":"2026-05-16T23:53:43.734622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.01346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:27:22.585602Z","title":"Large vision-language model alignment and misalignment: A survey through the lens of explainability","venue":null,"work_id":"eb9e4e70-8839-4a58-b512-97f072f5d676","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:4d83657089d6ca91cb269627c43a0d2a081d0adf8bf84509b746f9567f6df1d4","observation_id":"3b3bbf27-a853-45e7-a520-f34aff2159a4","resolution":{"observed_at":"2026-05-16T23:53:42.831307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit multimodal alignment: On the generalization of frozen llms to multi- modal inputs.Advances in Neural Information Processing Systems, 37:130848–130886","venue":null,"work_id":"5af17fee-d2d3-4a17-8aa4-7753d231caab","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:14a31a0e3c0ed3c22d6e78d1af499548748ba2e57208975e75a7d53a51fac910","observation_id":"54906976-e569-47dd-ab12-621841c58412","resolution":{"observed_at":"2026-05-16T23:53:43.726472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can vlms actually see and read? a survey on modality collapse in vision-language models","venue":null,"work_id":"be7900b1-fc87-43f4-8913-dda706a6141b","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:3bc2791d2b30c59bba722a7c9cfe334554d115e43d3cf551bb8658f0d9b72332","observation_id":"60b280d5-0c3d-4b31-938d-4cc16d19dcfc","resolution":{"observed_at":"2026-05-16T23:53:43.728845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:44:06.442067Z","title":"Towards vqa models that can read","venue":null,"work_id":"e5db9248-4d5c-4472-a057-81fd033bfc33","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:54273b495c6e57c984973c0fdb642295ab3177d8f9f6e001de2fabf7a13bc939","observation_id":"5843b2d5-4f6c-44ef-8e0d-bd96c7c5bd29","resolution":{"observed_at":"2026-05-16T23:53:43.731293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:c24e20aa8b56b7b0b604b04a75b5f96aa709d54060bab53be8c82c5cb3366461","observation_id":"d4b85dbf-9948-48fd-b1ce-e644443b3680","resolution":{"observed_at":"2026-05-16T23:53:42.863583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:d3fc0e5151bb31433bf93d44f63189a3651830e286c845e588ab124028c8466a","observation_id":"7fe26bc2-6141-4b98-856f-f0f32a9bfad4","resolution":{"observed_at":"2026-05-16T23:53:42.810041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Sys- tems, 37:95266–95290","venue":null,"work_id":"d17eb672-76a5-4c0f-a0b2-62feeb2d506b","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:7c51adc16e4f66276db289ea88b58b4dd0d08a8560b50b13dd31a63e5dd1adcf","observation_id":"e47361dd-c980-4304-a62c-686b6f60c25d","resolution":{"observed_at":"2026-05-16T23:53:43.724208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":"2510.18234","doi":"10.48550/arxiv.2510.18234","metadata_source":"pith","pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-OCR: Contexts Optical Compression","venue":"cs.CV","work_id":"e85551be-f243-4764-886f-76a8813ccbb8","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:bbdf0cf3e9697f4a6b7b4e8e6e7de100589eee46882311d3250c26c56e550819","observation_id":"0c09722c-09c7-4516-8c4b-8a5fc25217ba","resolution":{"observed_at":"2026-05-16T23:53:42.843074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2412.10302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-07-10T13:27:05.559849Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","venue":"cs.CV","work_id":"0fa0432e-2510-462b-954d-436d3b669375","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:580b1ed2ed2ab702aaa5f108a42f3794a2840c0bd0d6540ab75affbbb6b8c8fa","observation_id":"f325dff1-7aee-4b84-a507-45dde8614b54","resolution":{"observed_at":"2026-05-16T23:53:42.819295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16033","last_updated":"2025-06-10T18:32:17Z","snapshot_observed_at":"2026-07-06T20:40:52.927048Z","submitted_at":"2025-02-22T01:52:37Z","title":"Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":"2502.16033","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.16033","snapshot_observed_at":"2026-07-03T03:57:38.826132Z","title":"Multi- modal inconsistency reasoning (mmir): A new benchmark for multimodal reasoning models.ACL, 2025.https: //arxiv.org/abs/2502.16033","venue":null,"work_id":"e1579646-6174-4dbd-9f19-6be626f4b955","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2502.16033","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:6728cc2e73ba38565bf39b8df6a8b63a80356957bf32599f2cd450eccfcf7b6e","observation_id":"ae593e76-deed-40ef-a2f0-8995678414e6","resolution":{"observed_at":"2026-05-16T23:53:42.860433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multimodal large language models.National Science Review, 11(12): nwae403","venue":null,"work_id":"54d25361-d0bd-4ad6-81fd-1479a482f4e5","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:7b404da48682c8b4f1e8d28a73cb03784d11cb0925a3463c9af51d1f3e5e36fd","observation_id":"16645c6a-fe7d-4e50-9e8f-7dd4d34e5d90","resolution":{"observed_at":"2026-05-16T23:53:43.717680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi.CVPR","venue":null,"work_id":"ce97eff8-76f6-4003-8f20-6fd5414484bd","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:f3e33b6e63f370e4cf59eb744ed6fcf1784ebd399e7958be188661a4d2ee9c1a","observation_id":"4afca1b8-36af-4872-9d3e-b756c4d311e3","resolution":{"observed_at":"2026-05-16T23:53:43.713011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":"d9870bce-fc50-4d71-b8b9-a4dd3cc1f5be","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:5a1967da9dc1df922ed0e8f202e282118e89d1db9167c84f2680229763e887aa","observation_id":"589a76f0-0df6-47e9-bee1-2a261110dfcf","resolution":{"observed_at":"2026-05-16T23:53:43.693262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"740fd6d3-c130-4238-b409-42e8f03d0e7c","year":2024},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:49f67da67342a7cfd2f72ca7054a6cc4c23e79e535e51e6ae9fc6e1ded93d968","observation_id":"4fa82398-d1d5-474a-9a91-4008e3f7a5f1","resolution":{"observed_at":"2026-05-16T23:53:43.710916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:52d514ea8b370d31a8e767c5c3ba055d56dce8f66790e649429b56d4122db3f1","observation_id":"d1440028-f5c9-4e3b-98b2-809c01b43c95","resolution":{"observed_at":"2026-05-16T23:53:42.839388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2A + B = 15","venue":null,"work_id":"fa59e412-282a-4c14-a832-507e50ac96b4","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:f284a9db48728a412ac472a6feef2abf567fe32f2ddfdc07b7cab2ef1bfcb2fd","observation_id":"8d104479-2ce9-4e3e-89d7-c282b2ac5f93","resolution":{"observed_at":"2026-05-16T23:53:43.714896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-source models follow vLLM’s recommended con- figurations for optimal performance","venue":null,"work_id":"7eba6618-16c1-4738-bb05-63f921baba34","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:c4a9430cb7e4e30e04fff33ae278d7ae33226862b4b4740517dac9b54ca1bdb0","observation_id":"9083f459-afaf-4966-a411-c16d97baf504","resolution":{"observed_at":"2026-05-16T23:53:43.719732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"96b00fcd-8f93-4292-a8d1-781be9621fa8","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:d95c6742a2985ea8a538dabe576dfcb337bdb8d140c11e31d16e7977cfb343e8","observation_id":"aff17873-d202-4236-82ae-b308bed27214","resolution":{"observed_at":"2026-05-16T23:53:43.721801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Please transcribe now","venue":null,"work_id":"94d2f675-b087-4c19-b5c6-998e27764f95","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:e7ecf856d23ab48c9d5d98c6b848aaf8f85657e245558fd33969c105768480aa","observation_id":"4919310a-3e2d-4e33-858b-144c73884cff","resolution":{"observed_at":"2026-05-16T23:53:43.706121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7df72e0e-a1c7-48cd-a5c7-5c0ba91efea7","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:11e198192a9277e90c09683423905bca181eb4d0d43bab7b91c23a4c86239a2a","observation_id":"ff4b2e3c-aa2d-42d9-8cbf-f04827f9239d","resolution":{"observed_at":"2026-05-16T23:53:43.708346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"254b8689-d3a6-48a2-b306-62e06deb2779","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:b458af8958917518c325fe04ea5832910a75e78188bfbdec51a93eb4bbd0a590","observation_id":"80e681cc-4f07-46ab-80f8-db1826b653c9","resolution":{"observed_at":"2026-05-16T23:53:43.703977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"293b3008-fb92-489f-a819-7327e0bbc876","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:ea7e84d5baefdeee77a5e6a0b5630789c587f2dae6cb0c33f7dd2d07e3ffd276","observation_id":"84c410b5-148c-4dcd-90e0-d5930986959e","resolution":{"observed_at":"2026-05-16T23:53:43.699022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be12b59b-4b40-4e42-b1d7-8777125b700b","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:a203ac18b796df642faac7b3cdab1327743ca566a7114d55dd703b4ac28f567b","observation_id":"6e6ee886-1cbe-46f2-b96b-1ca12f7d06c0","resolution":{"observed_at":"2026-05-16T23:53:43.695382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e7d420a-c65f-4963-b0bd-b8064700dfe5","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:dffc2445447e708d6a364fd0955b204ecda3092b7913ff197c5c934cc6eab7d0","observation_id":"b205d216-89bc-4f31-ad83-31c9d435137e","resolution":{"observed_at":"2026-05-16T23:53:43.691091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Format your output like so: (1) 2a + 3b = 10 (2) a + 3c = 30 (3) 2b + 5c = ? Please transcribe now","venue":null,"work_id":"a5bad274-2130-4d54-ab9d-7e08818d4a3e","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:c8c9f20ccf76e006f43930b6f83f0130a0e14389caecb49a6c4b14adf6dbb00f","observation_id":"5169d7d2-0314-47b0-87fe-0124493ff0a6","resolution":{"observed_at":"2026-05-16T23:53:43.701503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OCR-first","venue":null,"work_id":"b605a3c5-3c77-457e-9c46-c9379e05daa0","year":null},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:c910905bc589314e0f3a13e7548a5254817dae6c0fcafcf3aa4ebe596725113a","observation_id":"613873bb-867a-437e-bcfe-216708b10fd5","resolution":{"observed_at":"2026-05-16T23:53:43.686739Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image accuracy, RER consistency and OCR correct scores stratified by resolution (50, 100, 200 DPI) for all questions","venue":null,"work_id":"8f49c79a-229d-4104-ac71-f471739a3025","year":2025},"citing_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T23:52:13.813452Z"},"links":{"citing_paper":"/paper/2512.08923"},"observation_digest":"sha256:75f998b99db39e5816d5c9e9ee03996d046cf362693ae78e0fa9087dad3aec93","observation_id":"86e56011-75ea-4e83-add1-2007859ee779","resolution":{"observed_at":"2026-05-16T23:53:43.684161Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":19,"verified_fuzzy":29},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2512.08923."}