{"as_of":"2026-08-09T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f0826c60c3c523479b1162a5ebb1b2ad0799581bbe4802eb8d2fe477a0dc3ca","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:53.793245Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T14:16:53.793245Z","title":"A survey of multimodal retrieval- augmented generation.arXiv preprint arXiv:2504.08748, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.793245Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:57b19161086dd75c8b982f213a9553956228df54f96810b270b7bf914052b799","observation_id":"fd11a890-692d-48c2-8917-d8f7d020f9f6","resolution":{"observed_at":"2026-08-07T14:16:53.793245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2505.22095","last_updated":"2026-04-06T12:52:40Z","snapshot_observed_at":"2026-08-02T15:44:17.473900Z","submitted_at":"2025-05-28T08:17:57Z","title":"Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T13:50:30.090068Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.22095"},"observation_digest":"sha256:5cabdc90426d9f80c21e4d9f419bfb1d31d8aa0a97c62dff9174326df8695409","observation_id":"2be64108-7341-4319-82ad-26b9babc0484","resolution":{"observed_at":"2026-05-19T13:52:19.911032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T12:42:25.485699Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24073","last_updated":"2025-08-26T16:42:37Z","snapshot_observed_at":"2026-08-07T21:48:31.035838Z","submitted_at":"2025-05-29T23:32:03Z","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:42:25.485699Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.24073"},"observation_digest":"sha256:3f210b86dff2db0d4c6fca26af611502a7ee1ef2c3708581881f4673cd67ad90","observation_id":"8277179e-947e-474e-9d71-f8f8c542bb2c","resolution":{"observed_at":"2026-08-07T12:42:25.485699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T12:09:35.030118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02037","last_updated":"2025-09-01T10:49:18Z","snapshot_observed_at":"2026-08-08T09:28:42.352039Z","submitted_at":"2025-05-31T03:50:19Z","title":"FinS-Pilot: A Benchmark for Online Financial RAG System","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:35.030118Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2506.02037"},"observation_digest":"sha256:04d69fe9aeaa82f03a3f190518a8132004fd59db2b3c8c74db7756dd9d54593e","observation_id":"2291e17b-ceb8-4b2a-9ff8-f079b11ede24","resolution":{"observed_at":"2026-08-07T12:09:35.030118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T10:19:19.431632Z","title":"A survey of multimodal retrieval- augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05766","last_updated":"2025-06-06T05:48:22Z","snapshot_observed_at":"2026-08-07T20:58:18.248298Z","submitted_at":"2025-06-06T05:48:22Z","title":"BioMol-MQA: A Multi-Modal Question Answering Dataset For LLM Reasoning Over Bio-Molecular Interactions","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:19.431632Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2506.05766"},"observation_digest":"sha256:603c10e721c045cf493105344cba87a72bcefcb825ece10f1d07d8e2f465b938","observation_id":"93663203-679f-4c4a-8523-67eca9437942","resolution":{"observed_at":"2026-08-07T10:19:19.431632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-06T13:20:35.866564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20804","last_updated":"2026-07-18T05:33:43Z","snapshot_observed_at":"2026-08-06T13:20:34.959928Z","submitted_at":"2025-07-28T13:16:23Z","title":"MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:20:35.866564Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2507.20804"},"observation_digest":"sha256:9829573d3abbd524dc6a02df34181dffa1fa588ea4e3ec4a233c6eef0ac92c02","observation_id":"e63c4cbd-17db-4e25-b0e9-3078d9b98304","resolution":{"observed_at":"2026-08-06T13:20:35.866564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T22:51:59.142513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.142513Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:5aef4f3a57c941fbcd8a25d4955c6c3c9c4eb461d6b48e29b40a8ab7192878e5","observation_id":"7f2d4f58-ed45-42a5-8180-7b25e43619f3","resolution":{"observed_at":"2026-08-05T22:51:59.142513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2510.15253","last_updated":"2026-04-20T08:38:26Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-17T02:33:16Z","title":"Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T06:54:03.390655Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2510.15253"},"observation_digest":"sha256:563e41163df6e62b5a400bfa21fe9b3f89a48ae397774aeb034a0a004be817bc","observation_id":"6b316e97-048c-493f-bad3-124a33b89700","resolution":{"observed_at":"2026-05-18T06:56:01.613677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T09:36:21.184692Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2601.04720"},"observation_digest":"sha256:67af415f403c5fd23e5f6aca677a60af86ac87a096edd49568429a04437a4155","observation_id":"8128c3f8-76fc-4c91-bb41-a444e2851d80","resolution":{"observed_at":"2026-05-12T09:36:21.318739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2602.19549","last_updated":"2026-04-20T01:43:08Z","snapshot_observed_at":"2026-07-06T22:46:45.213871Z","submitted_at":"2026-02-23T06:45:19Z","title":"Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:06.005832Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2602.19549"},"observation_digest":"sha256:6c213fd93a1b558718e21b98f0917927a449a6ec0e0dddb1d28da38153f12d0f","observation_id":"8945ed12-3d25-4a66-88ab-68ef2bc0f9c5","resolution":{"observed_at":"2026-05-15T20:56:37.033893Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-03T03:30:18.930328Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29897","last_updated":"2026-05-24T03:07:49Z","snapshot_observed_at":"2026-08-07T14:16:57.757482Z","submitted_at":"2026-02-08T12:39:19Z","title":"UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:18.930328Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2603.29897"},"observation_digest":"sha256:cd742265c5c1e65f96f2984a2c872393df602bfa25f18118f64e079d705f41e9","observation_id":"6a31d743-c9d5-4e60-9e78-34b2649db88f","resolution":{"observed_at":"2026-08-03T03:30:18.930328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.07784","last_updated":"2026-04-09T04:22:18Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:22:18Z","title":"Automotive Engineering-Centric Agentic AI Workflow Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:32:09.896596Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.07784"},"observation_digest":"sha256:ba52406356fc8e84913b6265af06b9de01a510ea61617a97d6bc0899bf14bf0a","observation_id":"d74c94ea-8047-4054-9ed0-9aefff2d53dc","resolution":{"observed_at":"2026-05-11T06:41:01.226204Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.12735","last_updated":"2026-08-05T08:52:46Z","snapshot_observed_at":"2026-08-09T03:20:26.673676Z","submitted_at":"2026-04-14T13:49:19Z","title":"AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T15:21:42.285340Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.12735"},"observation_digest":"sha256:c0937a07850a436cb3e4201bdedf2479b92c5075f428da3430a4e9909e54f157","observation_id":"ccccbf5e-fb25-4bc9-839c-bf4d327599ba","resolution":{"observed_at":"2026-05-11T10:41:05.717876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.12890","last_updated":"2026-04-25T02:32:57Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:40:28Z","title":"Towards Long-horizon Agentic Multimodal Search","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:40:32.137708Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.12890"},"observation_digest":"sha256:b1724ef6185ac16698a228054a3a6512f671c15d3f6fb32071bf460a859ad88e","observation_id":"dffa2eb4-0b5c-4239-b797-7dbabe59dc9b","resolution":{"observed_at":"2026-05-11T10:01:04.600009Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.24564","last_updated":"2026-04-30T01:34:01Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:51:00Z","title":"MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T03:51:49.033280Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.24564"},"observation_digest":"sha256:205e5ec7318a66dbf325f0a7c8e2e53ce6967322341fdf31822305f57a37eb85","observation_id":"12fd3f85-51bb-48dc-9b77-aa692b8e169f","resolution":{"observed_at":"2026-05-11T21:56:12.234750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.27600","last_updated":"2026-04-30T08:50:03Z","snapshot_observed_at":"2026-07-06T23:13:02.921765Z","submitted_at":"2026-04-30T08:50:03Z","title":"Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T07:19:44.125479Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.27600"},"observation_digest":"sha256:7d95f07ab8459b18f794b70b20398efaac46ddb357b08230462fdeba1c9912a1","observation_id":"99a10e23-1b13-4993-8d8c-e12b24ed7cc5","resolution":{"observed_at":"2026-05-12T10:11:28.189192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:00c18cb64c49a147b50cd75361f044957d6337f310cfc953c5e6430b95c96bf9","observation_id":"d3c4e3c1-6dcd-408d-8fbd-307c3c60fe3f","resolution":{"observed_at":"2026-05-11T16:01:22.785950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:01596f8d594a21b02a035e8755194f8053ad703b3be49a9e86c5fd5dab0e5bd2","observation_id":"2e88b10f-7c82-4021-aa6e-8fda353e0bad","resolution":{"observed_at":"2026-05-11T01:50:51.632248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.08421","last_updated":"2026-05-08T19:28:46Z","snapshot_observed_at":"2026-08-03T20:04:29.535256Z","submitted_at":"2026-05-08T19:28:46Z","title":"Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T01:16:05.097254Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.08421"},"observation_digest":"sha256:e6a1b948ffd608fc0a1d2d449ebc2249f5256d3643f94e2563b2d2e3265a7e90","observation_id":"382471ef-c43d-40df-a880-c829ae399771","resolution":{"observed_at":"2026-05-12T08:06:36.550726Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.10253","last_updated":"2026-05-11T09:22:53Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T09:22:53Z","title":"Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T05:29:41.946357Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.10253"},"observation_digest":"sha256:8bf5ec88cd5cfbb654528533c1640149d450e7f78eb9b63f497d9c99a4e2c5da","observation_id":"22b17097-7bb2-4c17-ab7d-dbbb5b0f797d","resolution":{"observed_at":"2026-05-12T05:31:23.639994Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.11864","last_updated":"2026-05-12T09:45:59Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:45:59Z","title":"Very Efficient Listwise Multimodal Reranking for Long Documents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:19.587925Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.11864"},"observation_digest":"sha256:2ddd8d0e0e8aa76eb8c909c757053d62a7902e99aef2ffdfab6fb675ddd791f2","observation_id":"a45ee65b-15ef-4008-a266-de4e78c4cb4e","resolution":{"observed_at":"2026-05-13T05:27:19.556692Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.13277","last_updated":"2026-05-13T09:54:31Z","snapshot_observed_at":"2026-07-31T16:56:58.325856Z","submitted_at":"2026-05-13T09:54:31Z","title":"Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-14T19:09:18.975682Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.13277"},"observation_digest":"sha256:666e2a10c641bbf9cc89e845596b12f4210adf567588c5233343b98ef86e1af4","observation_id":"ec951658-6e71-4dda-82ef-60d60daa5ef8","resolution":{"observed_at":"2026-05-14T19:09:22.904045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.18884","last_updated":"2026-05-16T10:04:48Z","snapshot_observed_at":"2026-08-01T06:16:30.439623Z","submitted_at":"2026-05-16T10:04:48Z","title":"Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T15:55:57.330888Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.18884"},"observation_digest":"sha256:50a4e8054c216e256dcd2715196c1e5ffef4e22d782035f1e1cfd66e563f8fb7","observation_id":"d14aac79-9764-4d19-9424-6704c4a81a88","resolution":{"observed_at":"2026-05-20T15:58:32.660160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.04231","last_updated":"2026-06-02T21:31:47Z","snapshot_observed_at":"2026-08-02T18:27:50.227511Z","submitted_at":"2026-06-02T21:31:47Z","title":"MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T09:52:28.556039Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.04231"},"observation_digest":"sha256:a0dc11979d0650d716d0f396312ea4ea4b8838a4894610b144a39a3fc19560dc","observation_id":"f42ffe12-2138-489f-9dcc-06df3ffe15cf","resolution":{"observed_at":"2026-07-02T03:36:29.830258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.25343","last_updated":"2026-06-26T04:35:35Z","snapshot_observed_at":"2026-08-06T22:43:48.099674Z","submitted_at":"2026-06-24T03:17:30Z","title":"Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:12.242955Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.25343"},"observation_digest":"sha256:d84b2ea8d81aa3cc8d1b8a85ac7bb7c918c2c66e5b94ee8769aad64ac9151269","observation_id":"d8d13eb5-b3df-46fc-8ef1-c0b21683634a","resolution":{"observed_at":"2026-07-04T19:30:07.791252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.25343","last_updated":"2026-06-26T04:35:35Z","snapshot_observed_at":"2026-08-06T22:43:48.099674Z","submitted_at":"2026-06-24T03:17:30Z","title":"Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T05:07:28.537679Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.25343"},"observation_digest":"sha256:187d5d9f14bf987e01e5f36bfea79fb01d7f1b2e9ae067ffa915a8f5c98e70f7","observation_id":"74057d3c-df7d-4041-b855-899528be2e64","resolution":{"observed_at":"2026-06-29T18:23:51.232989Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.26458","last_updated":"2026-06-24T23:38:42Z","snapshot_observed_at":"2026-08-02T19:46:19.775072Z","submitted_at":"2026-06-24T23:38:42Z","title":"MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T01:11:45.657964Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.26458"},"observation_digest":"sha256:98b668054ca84d7bb1cdd0e2ecbb99881197c534a35403e0de3d1b472970fcf5","observation_id":"4c728f44-40a2-403e-911f-cd84412a9c4e","resolution":{"observed_at":"2026-06-27T01:10:20.757282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2607.00685","last_updated":"2026-07-01T09:30:10Z","snapshot_observed_at":"2026-07-07T00:06:20.346610Z","submitted_at":"2026-07-01T09:30:10Z","title":"M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-02T03:31:24.102843Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2607.00685"},"observation_digest":"sha256:adbc32ce3ca47fee9c10eddaec71ae41c678646193805353f26a57114c781b51","observation_id":"e3df4522-b9cd-41e3-bc35-4414ab61d570","resolution":{"observed_at":"2026-07-02T03:36:29.074287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-01T03:45:20.175586Z","title":"A survey of multimodal retrieval-augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24850","last_updated":"2026-07-25T06:47:46Z","snapshot_observed_at":"2026-08-08T08:58:37.892841Z","submitted_at":"2026-07-25T06:47:46Z","title":"SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T03:45:20.175586Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2607.24850"},"observation_digest":"sha256:62c0dd361ce8f22d61a2f920bae3801bfba1ab42fe114fc2cd95b17e27fb48f2","observation_id":"ecb0fe80-b1b7-4aed-ac52-18b0db7f01f6","resolution":{"observed_at":"2026-08-01T03:45:20.175586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-07-31T03:11:54.590831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28580","last_updated":"2026-07-30T17:40:05Z","snapshot_observed_at":"2026-08-08T02:41:20.995613Z","submitted_at":"2026-07-30T17:40:05Z","title":"DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T03:11:54.590831Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2607.28580"},"observation_digest":"sha256:ad1ae5aab41957f4b87d032c51c780fce97ae265415471c44c29d0a2c7a0b2f7","observation_id":"bdaf9895-c1da-4dd6-bef1-35e27fbef9aa","resolution":{"observed_at":"2026-07-31T03:11:54.590831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-06T00:30:31.505780Z","title":"A survey of multimodal retrieval- augmented generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03161","last_updated":"2026-08-04T05:48:05Z","snapshot_observed_at":"2026-08-07T23:10:40.368824Z","submitted_at":"2026-08-04T05:48:05Z","title":"Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:31.505780Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2608.03161"},"observation_digest":"sha256:87a912b613f3e02fb18423feea4d5ecf5df6016abd19dfe708b812745b524047","observation_id":"381b2318-a7f7-476b-9142-31892c89e5ca","resolution":{"observed_at":"2026-08-06T00:30:31.505780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.08748/citation-record","integrity":"/paper/2504.08748/integrity","json":"/paper/2504.08748/citation-record.json","paper":"/paper/2504.08748"},"outbound":[],"paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2504.08748."}