{"as_of":"2026-08-09T00:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4624336ffd52ccc2902007a1559e85b4f415dd5e56fe5edcce1103d24c306a8a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:35:56.696199Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:42:23.389782Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T13:52:19.900688Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":"2502.08826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M.; Zobeiri, A.; Dehghani, M.; Mohammadkhani, M.; Mohammadi, B.; Ghahroodi, O.; Baghshah, M","venue":null,"work_id":"e9868c0e-7c7d-48d7-b90e-0d732b104ca1","year":2025},"citing_paper":{"arxiv_id":"2505.22095","last_updated":"2026-04-06T12:52:40Z","snapshot_observed_at":"2026-08-02T15:44:17.473900Z","submitted_at":"2025-05-28T08:17:57Z","title":"Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T13:50:30.090068Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2505.22095"},"observation_digest":"sha256:b7ebfce5cca1cf266db8a037f1d895fd977e197ebbe0a78959017dff24d9a4ea","observation_id":"957e7946-809c-4644-8e59-59e001502df2","resolution":{"observed_at":"2026-05-19T13:52:19.903166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-07T12:42:23.389782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24073","last_updated":"2025-08-26T16:42:37Z","snapshot_observed_at":"2026-08-07T21:48:31.035838Z","submitted_at":"2025-05-29T23:32:03Z","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:42:23.389782Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2505.24073"},"observation_digest":"sha256:38e8072ef9f630864e9d96cbd119ff59d741178ad29d4b9be14c9f375cc82dd5","observation_id":"1cedabc9-ef10-483d-a9ac-9c3fd76c3476","resolution":{"observed_at":"2026-08-07T12:42:23.389782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-07T10:19:09.656161Z","title":"Ask in any modality: A comprehensive survey on multimodal retrieval- augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05766","last_updated":"2025-06-06T05:48:22Z","snapshot_observed_at":"2026-08-07T20:58:18.248298Z","submitted_at":"2025-06-06T05:48:22Z","title":"BioMol-MQA: A Multi-Modal Question Answering Dataset For LLM Reasoning Over Bio-Molecular Interactions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.656161Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2506.05766"},"observation_digest":"sha256:7a071bdf713a2f2a6ce335ba55e85ee4c86d9da6445dd22fb4a90efa3acb263a","observation_id":"dc872ce5-6551-497e-8d92-014e2e7d0332","resolution":{"observed_at":"2026-08-07T10:19:09.656161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-07T05:35:50.716342Z","title":"Ask in any modality: A comprehensive survey on multimodal retrieval-augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.716342Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:0450f821248ab07dfce24907e546573d0fcb2c891f53642ca3ab19080793e565","observation_id":"0f78863e-e058-499f-8271-8b3df8218a37","resolution":{"observed_at":"2026-08-07T05:35:50.716342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-07T04:57:53.267960Z","title":"Ask in any modality: A comprehensive survey on multimodal retrieval-augmented generation.arXiv preprint arXiv:2502.08826, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09247","last_updated":"2025-06-10T21:04:18Z","snapshot_observed_at":"2026-08-07T04:51:03.799303Z","submitted_at":"2025-06-10T21:04:18Z","title":"Agent-based Condition Monitoring Assistance with Multimodal Industrial Database Retrieval Augmented Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:53.267960Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2506.09247"},"observation_digest":"sha256:81e5660c49a7c9eedb4ff511f2344da9dc2b937543bb1ad93c733c802d4823ff","observation_id":"bb752c60-9d6e-41af-83c0-657c8d2a317e","resolution":{"observed_at":"2026-08-07T04:57:53.267960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-07T12:33:12.540766Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11063","last_updated":"2025-05-30T06:48:02Z","snapshot_observed_at":"2026-08-07T12:24:50.968001Z","submitted_at":"2025-05-30T06:48:02Z","title":"Who is in the Spotlight: The Hidden Bias Undermining Multimodal Retrieval-Augmented Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:33:12.540766Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2506.11063"},"observation_digest":"sha256:28685e89150a8fc102e092f02805a2514a278d3b193743fc1c843c35c8af6974","observation_id":"de6869c8-7c6c-4e41-8853-6f95fe75901c","resolution":{"observed_at":"2026-08-07T12:33:12.540766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":"2502.08826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M.; Zobeiri, A.; Dehghani, M.; Mohammadkhani, M.; Mohammadi, B.; Ghahroodi, O.; Baghshah, M","venue":null,"work_id":"e9868c0e-7c7d-48d7-b90e-0d732b104ca1","year":2025},"citing_paper":{"arxiv_id":"2604.02640","last_updated":"2026-04-03T02:10:37Z","snapshot_observed_at":"2026-07-06T22:51:57.889822Z","submitted_at":"2026-04-03T02:10:37Z","title":"Overcoming the \"Impracticality\" of RAG: Proposing a Real-World Benchmark and Multi-Dimensional Diagnostic Framework","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T20:27:57.033386Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2604.02640"},"observation_digest":"sha256:3d391ec89877eed6f9c0e1713650c4cc12e8e9809ec9e9f20685aed073b8cf48","observation_id":"1cfaa1fa-b651-45fa-839b-1778fcca0cdf","resolution":{"observed_at":"2026-05-13T20:28:13.933168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":"2502.08826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M.; Zobeiri, A.; Dehghani, M.; Mohammadkhani, M.; Mohammadi, B.; Ghahroodi, O.; Baghshah, M","venue":null,"work_id":"e9868c0e-7c7d-48d7-b90e-0d732b104ca1","year":2025},"citing_paper":{"arxiv_id":"2604.24564","last_updated":"2026-04-30T01:34:01Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:51:00Z","title":"MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T03:51:49.033280Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2604.24564"},"observation_digest":"sha256:ef9516bad8138a59a90b4ca7fd261d4a58de7630f3e9bdc8146d0699ec43b28e","observation_id":"6f17bf5d-868b-44ac-bd91-732d05df83fe","resolution":{"observed_at":"2026-05-11T21:56:12.212336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":"2502.08826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M.; Zobeiri, A.; Dehghani, M.; Mohammadkhani, M.; Mohammadi, B.; Ghahroodi, O.; Baghshah, M","venue":null,"work_id":"e9868c0e-7c7d-48d7-b90e-0d732b104ca1","year":2025},"citing_paper":{"arxiv_id":"2604.27600","last_updated":"2026-04-30T08:50:03Z","snapshot_observed_at":"2026-07-06T23:13:02.921765Z","submitted_at":"2026-04-30T08:50:03Z","title":"Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T07:19:44.125479Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2604.27600"},"observation_digest":"sha256:4d336aeb8f8828c28dae124f9d7f6ff4108febc854447c904fb04e2acce2ad28","observation_id":"88a20606-a9f0-467e-b96e-515ad028ab75","resolution":{"observed_at":"2026-05-12T10:11:28.128622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-07-12T02:37:53.169236Z","title":"arXiv preprint arXiv:2502.08826 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05438","last_updated":"2026-07-03T15:28:16Z","snapshot_observed_at":"2026-08-07T19:15:47.076324Z","submitted_at":"2026-07-03T15:28:16Z","title":"Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-12T02:37:53.169236Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2607.05438"},"observation_digest":"sha256:4b86b434459a6b87f88fcfeed7e5d124c22711c5726101bc08888e936ec44f4f","observation_id":"3a3a43eb-8e9a-4a81-8bd4-4c349282aea8","resolution":{"observed_at":"2026-07-12T02:37:53.169236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-02T10:20:56.226707Z","title":"arXiv preprint arXiv:2502.08826 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-08T03:20:50.943223Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:56.226707Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:4fccce5135eb951aaa6f65a1c6ccfd89575cf4632058fd522ca144bccc57cd30","observation_id":"703b3f3f-fbfa-4d1d-81b3-de9fd80f5d68","resolution":{"observed_at":"2026-08-02T10:20:56.226707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08826/citation-record","integrity":"/paper/2502.08826/integrity","json":"/paper/2502.08826/citation-record.json","paper":"/paper/2502.08826"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-07T23:35:56.592793Z","title":"Preprint, arXiv:2407.01449","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.592793Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:fb6c5a0c9e5e0150f905f703fb7cadc0801797d905dceacd7cde9d410ddd77cb","observation_id":"05af56c5-002d-4b9e-86e3-878fb9b05e28","resolution":{"observed_at":"2026-08-07T23:35:56.592793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11207","last_updated":"2025-01-13T18:16:34Z","snapshot_observed_at":"2026-08-05T12:09:02.119453Z","submitted_at":"2023-06-20T00:14:47Z","title":"Quilt-1M: One Million Image-Text Pairs for Histopathology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11207","snapshot_observed_at":"2026-08-07T23:35:56.596727Z","title":"ACM Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.596727Z"},"links":{"cited_paper":"/paper/2306.11207","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:e1876233b413e36940f12358665c5fbde8aa2211ee397b1f98a15c93b112a738","observation_id":"6a87a8cb-ba8b-44c6-b64b-0d440ab080ec","resolution":{"observed_at":"2026-08-07T23:35:56.596727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05635","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.054459Z","title":"In Proceedings of the Seventh Fact Extraction and VERification Work- shop (FEVER), pages 280–296, Miami, Florida, USA","venue":null,"work_id":"4b47c940-de19-4167-bd90-a59a6ea1aab8","year":2025},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.600566Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:3338b37b9a0660fd03d6b59ff9e5299bf607a028dbacf5a079cdf8e980f249ac","observation_id":"8bba59d9-2c57-4b31-bf42-5a430becd9f1","resolution":{"observed_at":"2026-08-07T23:35:57.060328Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03995","last_updated":"2025-01-07T18:52:05Z","snapshot_observed_at":"2026-08-05T04:33:26.143579Z","submitted_at":"2025-01-07T18:52:05Z","title":"RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03995","snapshot_observed_at":"2026-08-07T23:35:56.611119Z","title":"In ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.611119Z"},"links":{"cited_paper":"/paper/2501.03995","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:4147b3bcb00492093ce4c0b277d4f981c8058f07d0ba7405731ae3cb04174b5c","observation_id":"5ef38721-359e-40b8-807a-e07e6cb9b81b","resolution":{"observed_at":"2026-08-07T23:35:56.611119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18104","last_updated":"2024-10-08T16:26:18Z","snapshot_observed_at":"2026-07-06T19:38:39.889993Z","submitted_at":"2024-10-08T16:26:18Z","title":"ENWAR: A RAG-empowered Multi-Modal LLM Framework for Wireless Environment Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18104","snapshot_observed_at":"2026-08-07T23:35:56.614682Z","title":"arXiv preprint arXiv:2410.18104","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.614682Z"},"links":{"cited_paper":"/paper/2410.18104","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:2b5bb69270f8c595a9cb602c6a4ad90b76d4a48aaabf717f0127f21f15838227","observation_id":"9218ba7b-d40b-4ded-a336-e612624d698c","resolution":{"observed_at":"2026-08-07T23:35:56.614682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07626","last_updated":"2025-03-25T06:19:32Z","snapshot_observed_at":"2026-07-06T20:04:43.926718Z","submitted_at":"2024-12-10T16:05:56Z","title":"OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07626","snapshot_observed_at":"2026-08-07T23:35:56.618177Z","title":"Weihua Ou, Yingjie Chen, Linqing Liang, Jianping Gou, Jiahao Xiong, Jiacheng Zhang, Lingge Lai, and Lei Zhang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.618177Z"},"links":{"cited_paper":"/paper/2412.07626","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:bf45ff974990fa114e6359cd5bc429140e826164f1bb93dca3fc3614c0a74f42","observation_id":"0a4e7827-97ca-416c-80b4-8d28d47004fc","resolution":{"observed_at":"2026-08-07T23:35:56.618177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.197741Z","title":"In EMNLP-Findings","venue":null,"work_id":"113bfcab-16fc-493d-94b9-f673dcfbf1b2","year":2019},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.625048Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:c630b9202ad76296501d4763057b81c8aba72d1dde97a44fd72bcb7c08014088","observation_id":"43e93990-8672-4384-8f17-d2c0a2a14b34","resolution":{"observed_at":"2026-08-07T23:35:57.200681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T23:35:56.628121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.628121Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:685508446526ba4cccd0ba09cfd50d810e87631aa8e5d6e4b720e99119cb3566","observation_id":"3ab2d5fe-6f1a-448a-94e3-6567b66a70e8","resolution":{"observed_at":"2026-08-07T23:35:56.628121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01700","last_updated":"2025-04-02T13:00:17Z","snapshot_observed_at":"2026-08-07T16:14:42.787253Z","submitted_at":"2025-04-02T13:00:17Z","title":"Reasoning LLMs for User-Aware Multimodal Conversational Agents","version":1},"cited_work":{"arxiv_id":"2504.01700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.01700","snapshot_observed_at":"2026-08-07T23:35:56.929482Z","title":"Reasoning LLMs for User-Aware Multimodal Conversational Agents","venue":"cs.HC","work_id":"10dce5e0-579b-4e62-8067-83be2a51d10a","year":2025},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.631646Z"},"links":{"cited_paper":"/paper/2504.01700","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:908a527c7b634c2e3de16348f9cedaf1395982b02234958a341fd7ed4733b399","observation_id":"c0a0c812-13ae-463b-ae08-72ba0ec64ed4","resolution":{"observed_at":"2026-08-07T23:35:56.932994Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19150","last_updated":"2024-06-27T13:08:35Z","snapshot_observed_at":"2026-07-06T18:37:55.945869Z","submitted_at":"2024-06-27T13:08:35Z","title":"RAVEN: Multitask Retrieval Augmented Vision-Language Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19150","snapshot_observed_at":"2026-08-07T23:35:56.635121Z","title":"Preprint, arXiv:2406.19150","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.635121Z"},"links":{"cited_paper":"/paper/2406.19150","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:9be3eac295190eaeb66e16dca98c1168594e848b8dea29ecce858079a9cd5222","observation_id":"434af60d-f575-4461-b9b5-c5fa8b652af5","resolution":{"observed_at":"2026-08-07T23:35:56.635121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14011","last_updated":"2025-04-18T18:02:33Z","snapshot_observed_at":"2026-08-07T16:01:02.153271Z","submitted_at":"2025-04-18T18:02:33Z","title":"Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.14011","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.14011","snapshot_observed_at":"2026-08-07T23:35:56.901371Z","title":"Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation","venue":"cs.CV","work_id":"b47f710f-d1de-491b-8a4b-5f0bc5424489","year":2025},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.638407Z"},"links":{"cited_paper":"/paper/2504.14011","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:234da9635e0754e558c18a2189505b8794fb5813084966fbbf33e440128051ea","observation_id":"d86c8ca0-ce33-4a21-9e16-3b49d0ddde45","resolution":{"observed_at":"2026-08-07T23:35:56.906988Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09626","last_updated":"2018-04-30T16:57:00Z","snapshot_observed_at":"2026-08-07T16:08:52.487917Z","submitted_at":"2018-04-25T15:30:27Z","title":"Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09626","snapshot_observed_at":"2026-08-07T23:35:56.641630Z","title":"In Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, pages 5520–5530, Abu Dhabi, United Arab Emirates","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.641630Z"},"links":{"cited_paper":"/paper/1804.09626","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:c170e2f21195f720b41e825bc9e2a6657fe33346dacb005aa1ff8784a9199f05","observation_id":"160ac32f-3e20-4e8e-b23d-f07a6a600840","resolution":{"observed_at":"2026-08-07T23:35:56.641630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20834","last_updated":"2024-05-31T14:23:49Z","snapshot_observed_at":"2026-07-06T18:23:19.450809Z","submitted_at":"2024-05-31T14:23:49Z","title":"Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20834","snapshot_observed_at":"2026-08-07T23:35:56.645227Z","title":"Preprint, arXiv:2405.20834","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.645227Z"},"links":{"cited_paper":"/paper/2405.20834","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:82a3af8572125b100d2d3245425caa5d1db27a5b103dff5f5f8c75f2b84e0c9f","observation_id":"2e0b30f7-f02f-4163-9ad5-8bb04d200ac0","resolution":{"observed_at":"2026-08-07T23:35:56.645227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01313","last_updated":"2024-01-08T16:19:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T17:56:30Z","title":"A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01313","snapshot_observed_at":"2026-08-07T23:35:56.652468Z","title":"In Advances in Neural Information Processing Sys- tems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.652468Z"},"links":{"cited_paper":"/paper/2401.01313","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:7a1e6d60814ca2f9f43a5bcca35f8009e7479d285294a1b370bef82ac76f5f70","observation_id":"eded5b37-1dfd-46f0-97ce-b92c1073c59b","resolution":{"observed_at":"2026-08-07T23:35:56.652468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13085","last_updated":"2025-03-03T03:08:28Z","snapshot_observed_at":"2026-08-02T03:49:38.796672Z","submitted_at":"2024-10-16T23:03:27Z","title":"MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13085","snapshot_observed_at":"2026-08-07T23:35:56.656089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.656089Z"},"links":{"cited_paper":"/paper/2410.13085","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:29bc01f9a58280bc57c9bde574cd0d26a4b6e7f74f950cc3d89c46423cc7df6f","observation_id":"446b6532-d96d-450e-bd5d-1408315f2191","resolution":{"observed_at":"2026-08-07T23:35:56.656089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05141","last_updated":"2025-06-06T05:50:30Z","snapshot_observed_at":"2026-08-06T23:57:10.370112Z","submitted_at":"2024-11-07T19:50:28Z","title":"Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05141","snapshot_observed_at":"2026-08-07T23:35:56.659200Z","title":"Yibin Yan and Weidi Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.659200Z"},"links":{"cited_paper":"/paper/2411.05141","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:ff02fb807360d5da7494211036e7450409fbe7aed55890333b170134ac453a74","observation_id":"8cac02ab-68db-4eae-bbb7-469423258364","resolution":{"observed_at":"2026-08-07T23:35:56.659200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20734","last_updated":"2026-05-18T05:53:24Z","snapshot_observed_at":"2026-07-06T21:16:27.689435Z","submitted_at":"2025-04-29T13:18:58Z","title":"UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20734","snapshot_observed_at":"2026-08-07T23:35:56.662287Z","title":"In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 10502–10511","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.662287Z"},"links":{"cited_paper":"/paper/2504.20734","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:09d2edcfaa1552b9f3bdbbd1edb83aa810ad3027b916f67c98430dba399dd09a","observation_id":"fa924b93-b754-405b-b7e7-894f78269409","resolution":{"observed_at":"2026-08-07T23:35:56.662287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:56.665201Z","title":"Preprint, arXiv:2402.10828","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.665201Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:837c929455e2a48d71529d1e184e5fdb5cf7ec17658f140d2d1ea78a2ea7abe8","observation_id":"d33f88b7-94b0-435e-abb8-8ff90b8e6dbd","resolution":{"observed_at":"2026-08-07T23:35:56.665201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-06T11:46:20.152196Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-08-07T23:35:56.668315Z","title":"In 2019 International conference on document analysis and recognition (ICDAR), pages 1015–1022","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.668315Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:370399e5b99646af29dcdd5b2ebbed651ee8f5a8df36d34c28a592195dae2397","observation_id":"4cdd8dc1-59d3-454e-ac30-51e83ef4162a","resolution":{"observed_at":"2026-08-07T23:35:56.668315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.188762Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 22010–22019","venue":null,"work_id":"3c55f5a0-9085-4627-982a-43b18ca74e32","year":2014},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.671553Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:18476523c208166ef8fc22453e47ccf775659ded6d8822db7e1cf57ca7895c26","observation_id":"b51c1402-16a4-4739-ab7b-7c1b7375b8ae","resolution":{"observed_at":"2026-08-07T23:35:57.192093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.169528Z","title":null,"venue":null,"work_id":"b5db79bf-1fa3-446d-b285-2ddaa2d60996","year":2021},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.677990Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:578601ab7a709e74a544878179114472b0c37f425ec6434ab96752a605b8112c","observation_id":"c93073cb-44c9-452c-8baf-19e0c059e9f2","resolution":{"observed_at":"2026-08-07T23:35:57.172631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.159814Z","title":"Any-to-Any","venue":null,"work_id":"93bb1c3b-3c08-4f6a-8784-15bb568b30dd","year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.680732Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:a67f9c935bbdee07019e9c1cba7d2a7a17e5e85a8971c931b29e69f3d7538d8e","observation_id":"1f820524-db67-455b-8088-9d45c8098376","resolution":{"observed_at":"2026-08-07T23:35:57.163104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.149358Z","title":null,"venue":null,"work_id":"eaca97c7-1ef5-4b77-89a1-5425a0063588","year":2023},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.684008Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:fc3c7f71a0626c1a92289a1cba6daffe5260939c7c10824a030bba2e94eed59a","observation_id":"7599c248-0d31-4538-86bb-ac732037468d","resolution":{"observed_at":"2026-08-07T23:35:57.152643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.112283Z","title":null,"venue":null,"work_id":"1c504e8b-0686-4220-8225-8091dcb96aec","year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.696199Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:4492fc86c0594477aa72dfacd673490ded90794314156a3336001e537f852d72","observation_id":"57ee6bac-cabf-4d4f-8335-75ec5b950253","resolution":{"observed_at":"2026-08-07T23:35:57.115139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.179111Z","title":"In the med- ical domain, MIMIC-CXR (Johnson et al., 2019) and CheXpert (Irvin et al., 2019) facilitate tasks such as medical report generation","venue":null,"work_id":"66cdcdd1-87b8-4563-b33b-2e811cab2c05","year":2018},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.674941Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:3c63447fd7fb18a94d8c20a9d9c6fbc99cc7567925290c708304b09f2e6bfc01","observation_id":"3de8cf9a-4538-4be6-9770-a09f7bff2786","resolution":{"observed_at":"2026-08-07T23:35:57.182386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.140092Z","title":"SPIDEr (Liu et al., 2017), used in (Zhang et al., 2024c), combines both metrics","venue":null,"work_id":"b2d8d98d-f660-4b1a-bed1-88cbed043c3e","year":2017},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.686944Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:e0a5be0baa0fe060cf8e51fb1201dc81096445bc055a7381fc135be2ac15fd31","observation_id":"34e2f063-8de8-40ad-9246-26317cc008c8","resolution":{"observed_at":"2026-08-07T23:35:57.143120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.121340Z","title":"The formula for FID is: FID = ∥µr − µg∥2 + tr(Σr + Σg − 2 p ΣrΣg) (8) where µr and Σr are the mean and covariance of real images’ feature representations, respectively","venue":null,"work_id":"71e6ea43-4e23-47cd-a039-a33ed798239a","year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.692677Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:3e90f361b88fd2e16e1243ab93fe0b2455bd75febc5bf083674be2c64f005429","observation_id":"e29ca871-d3ae-4c9e-8696-6371df74f8a2","resolution":{"observed_at":"2026-08-07T23:35:57.124480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T23:35:56.648890Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 1–10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.648890Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:8e262b7a0ef78e0e680a4b83a96274080be5d2a6c6de7bd8be6606d3283de42b","observation_id":"185024ac-c874-460e-a6a2-0294e6e8da96","resolution":{"observed_at":"2026-08-07T23:35:56.648890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.130744Z","title":"CLIP Score (Hessel et al., 2021), used in (Shari- fymoghaddam et al., 2024; Zhang et al., 2024c), measures image-text similarity using CLIP (Radford et al., 2021)","venue":null,"work_id":"d0904b47-f1b2-4e79-8377-6f0fd6a37dc0","year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.689777Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:a6567e4da46a95c96d2492a14a67c91d74e81afa506f60876c8488255a3b1dde","observation_id":"974f99ed-c961-4ba0-9cd8-aaa90ee754f8","resolution":{"observed_at":"2026-08-07T23:35:57.133810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.216301Z","title":"In Proceedings of the IEEE/CVF winter conference on applications of computer vision, pages 2200–2209","venue":null,"work_id":"0cb03557-d32c-4ff8-a460-777f6769f3f8","year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.608089Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:255a3e3ede443ae351a9dd9095f4ca3d4cc4548200248dfe0b737d7389c1803f","observation_id":"83c22ffe-8966-4450-81ce-c10c02edf91a","resolution":{"observed_at":"2026-08-07T23:35:57.219450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:57.206577Z","title":"In Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval, SIGIR ’22, page 3360–3362, New York, NY , USA","venue":null,"work_id":"ca91c512-1e90-4aba-be88-740102e5890f","year":2015},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.621864Z"},"links":{"citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:b3fa34673b9404a3012da38be60e9990bd0755d48c0474dde75b96ea92b0e670","observation_id":"cc69f9b0-6d28-4543-85be-d828aafaed0c","resolution":{"observed_at":"2026-08-07T23:35:57.210062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17093","last_updated":"2024-07-06T04:40:19Z","snapshot_observed_at":"2026-07-06T18:20:31.458073Z","submitted_at":"2024-05-27T12:08:59Z","title":"DeeperImpact: Optimizing Sparse Learned Index Structures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17093","snapshot_observed_at":"2026-08-07T23:35:56.589123Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 1–10","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.589123Z"},"links":{"cited_paper":"/paper/2405.17093","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:d866769394dcf01ebe03ee5f154269ade76db8ec66a355298fee99d099085659","observation_id":"b55844db-be89-4d90-83cc-e23818038121","resolution":{"observed_at":"2026-08-07T23:35:56.589123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13071","last_updated":"2025-03-23T09:52:05Z","snapshot_observed_at":"2026-07-06T20:08:43.596697Z","submitted_at":"2024-12-17T16:38:10Z","title":"CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2412.13071","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13071","snapshot_observed_at":"2026-08-07T23:35:57.101917Z","title":"CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval","venue":"cs.CL","work_id":"68d8630b-03de-48b6-a701-a78634a482a5","year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.585075Z"},"links":{"cited_paper":"/paper/2412.13071","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:e6f183d1e5060c2feddfb95fb869c5ee5c8dbc095840a4832721a5f8cd4b938e","observation_id":"c2cad6b0-d883-48aa-87bf-d32062f03bd2","resolution":{"observed_at":"2026-08-07T23:35:57.105502Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01120","last_updated":"2025-06-14T00:49:08Z","snapshot_observed_at":"2026-07-06T20:15:40.852454Z","submitted_at":"2025-01-02T07:39:48Z","title":"Retrieval-Augmented Dynamic Prompt Tuning for Incomplete Multimodal Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01120","snapshot_observed_at":"2026-08-07T23:35:56.603869Z","title":"arXiv preprint arXiv:2501.01120","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:56.603869Z"},"links":{"cited_paper":"/paper/2501.01120","citing_paper":"/paper/2502.08826"},"observation_digest":"sha256:9106d5fc2d50f9da227991152ad30f35243fedbbb2131ba66396173cc386c184","observation_id":"1dc58f8b-d36e-4198-851d-26e621e7aacc","resolution":{"observed_at":"2026-08-07T23:35:56.603869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 11 inbound Pith citation observations for arXiv:2502.08826."}