{"as_of":"2026-08-13T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6af63e1505c7f896198e0a7d723b168b4819c927dc8690e646e11114dc100627","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:38:17.374945Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:15:14.692955Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T12:46:14.749364Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2505.22095","last_updated":"2026-04-06T12:52:40Z","snapshot_observed_at":"2026-08-12T21:09:04.668282Z","submitted_at":"2025-05-28T08:17:57Z","title":"Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T13:50:30.090068Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2505.22095"},"observation_digest":"sha256:a279dc4e403a9d9db5dfd4a7c9ec878325312096b4b592f03dec168167b29b58","observation_id":"571d8895-cb81-4a6f-9f88-fd0577c18585","resolution":{"observed_at":"2026-05-19T13:52:19.993606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-07T11:27:42.371621Z","title":"Jingyi Zhang, Jiaxing Huang, Sheng Jin, and Shijian Lu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02544","last_updated":"2025-06-04T06:31:54Z","snapshot_observed_at":"2026-08-09T02:39:57.691927Z","submitted_at":"2025-06-03T07:32:40Z","title":"CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:27:42.371621Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2506.02544"},"observation_digest":"sha256:ac31bcc0128d8531af2dd9fa09448e82172718c0f7c824f82f2b7e6e02536f0b","observation_id":"875aafb3-c194-4219-98e1-50d24b64f030","resolution":{"observed_at":"2026-08-07T11:27:42.371621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2508.05318","last_updated":"2026-04-27T09:35:27Z","snapshot_observed_at":"2026-08-02T15:08:55.264024Z","submitted_at":"2025-08-07T12:22:50Z","title":"mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T00:05:08.866244Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2508.05318"},"observation_digest":"sha256:0fd8f9ed3e09f83207091da98d70a02e62a4a8601c1c3dc950b777cf1d1a373e","observation_id":"0028bbce-5de7-4a43-97ad-17a3629fb18e","resolution":{"observed_at":"2026-05-19T00:06:55.031490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-05T23:26:28.640658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05320","last_updated":"2025-08-07T12:24:36Z","snapshot_observed_at":"2026-08-06T08:46:12.727788Z","submitted_at":"2025-08-07T12:24:36Z","title":"Towards integrated sensors for optimized OCT with undetected photons","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T23:26:28.640658Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2508.05320"},"observation_digest":"sha256:c7bded32d4e56314f70e0024128d11d87e5119900bb904f161601def767a3eb5","observation_id":"ba192c7a-0448-4bcb-b339-ddc3dd8396d8","resolution":{"observed_at":"2026-08-05T23:26:28.640658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-05T20:28:53.107445Z","title":"Zhang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-09T12:54:37.629481Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:53.107445Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:35713783606167f6f1e5667ef07d93f9cf4f9b7d1691a2c24a8d6ed2d98a0f1b","observation_id":"b2bdfe73-d43b-41af-85ab-ae2ccc4bbc60","resolution":{"observed_at":"2026-08-05T20:28:53.107445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2509.00798","last_updated":"2026-04-22T02:56:00Z","snapshot_observed_at":"2026-07-29T03:25:03.283753Z","submitted_at":"2025-08-31T11:14:54Z","title":"Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering","version":7},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-18T20:04:52.852253Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2509.00798"},"observation_digest":"sha256:83095857d981692d41adbeb15fc7405f153dc5bb65a40430967712ef3da978de","observation_id":"1cef374f-1c2e-4445-9c40-1aae5369ac16","resolution":{"observed_at":"2026-05-18T20:06:49.834243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-04T20:06:09.182830Z","title":"mR 2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-08T13:29:23.405653Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.182830Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:b5097df99d7bdcdc182656f081b4e9dccfafee3817a36113401e29105b32e535","observation_id":"c3f50af2-666a-4c96-9b4f-03dc62a0dc58","resolution":{"observed_at":"2026-08-04T20:06:09.182830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2601.13856","last_updated":"2026-04-07T08:27:33Z","snapshot_observed_at":"2026-08-12T23:20:27.697486Z","submitted_at":"2026-01-20T11:08:33Z","title":"QKVQA: Question-Focused Filtering for Knowledge-based VQA","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T12:53:59.668663Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2601.13856"},"observation_digest":"sha256:5369afb7c148786dc95a3b4e48388b8f1db869648a1799b54626c39932baef0f","observation_id":"75576e0d-ca0b-4215-afda-05b752adcfb2","resolution":{"observed_at":"2026-05-16T12:57:54.028617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2604.05818","last_updated":"2026-04-14T13:54:15Z","snapshot_observed_at":"2026-08-13T08:24:31.709698Z","submitted_at":"2026-04-07T12:52:38Z","title":"WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T19:59:10.657346Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2604.05818"},"observation_digest":"sha256:d47eb7647a37b3aa2e85d2f2df516bc68736d818e0c886a83410407f7f9ed9c8","observation_id":"cb79a4e0-3510-432c-8642-b6680e020dfe","resolution":{"observed_at":"2026-05-10T22:20:48.065154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2605.29602","last_updated":"2026-05-28T08:40:34Z","snapshot_observed_at":"2026-07-31T08:03:40.151420Z","submitted_at":"2026-05-28T08:40:34Z","title":"CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-06-29T08:14:20.558527Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2605.29602"},"observation_digest":"sha256:b3864b36644d3940508bb153989236350d4ef27e87346339b5ab9e8329b6c6de","observation_id":"8cb9be3d-a963-4268-b521-4e1250a7b597","resolution":{"observed_at":"2026-06-29T08:23:15.730102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2606.23881","last_updated":"2026-06-22T19:27:00Z","snapshot_observed_at":"2026-08-13T01:37:35.388018Z","submitted_at":"2026-06-22T19:27:00Z","title":"Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T08:12:14.829556Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2606.23881"},"observation_digest":"sha256:4396e915c4a9c92af142cff1dab13bc1f6a2e54a75019547be6939da1bb4f758","observation_id":"c2c2eb77-cb22-404b-8831-8d3126503c4c","resolution":{"observed_at":"2026-07-04T10:59:46.839046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":"2411.15041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-07-09T12:46:14.749364Z","title":"mR2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA //","venue":"cs.AI","work_id":"0c2722ec-00a0-4134-85a0-9d1af99f1e7b","year":2024},"citing_paper":{"arxiv_id":"2607.07383","last_updated":"2026-07-08T13:15:39Z","snapshot_observed_at":"2026-08-12T17:13:44.350901Z","submitted_at":"2026-07-08T13:15:39Z","title":"MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T12:37:07.906342Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2607.07383"},"observation_digest":"sha256:f2f4bb2c268d753412c6220d5d5a742798c8e28dedf84341350bb0ccc53c670f","observation_id":"aa6dbd07-ebad-41b7-b8e4-c04f6228adb9","resolution":{"observed_at":"2026-07-09T12:46:14.750625Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-02T10:20:50.701345Z","title":"arXiv preprint arXiv:2411.15041 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-08T03:20:50.943223Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:50.701345Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:48a1fa20121d105587690689d88561266ddd1c80f8cec70161f93e875f527445","observation_id":"11576698-4461-4e44-88f8-c8736543b8bb","resolution":{"observed_at":"2026-08-02T10:20:50.701345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-06T00:31:17.751661Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-13T07:47:45.515497Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:17.751661Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:92b11102ed69eb2613367718b5ef9b2e1f5fef4c7e73bb32f73e3e4bd3109c4d","observation_id":"b8c9e70d-aa80-4e22-a27a-d2696ec8f8d1","resolution":{"observed_at":"2026-08-06T00:31:17.751661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-06T04:19:53.771485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-13T07:47:45.515497Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.771485Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:b665ea7cb667c854106022e4247647737729074263d84f572fe467a9a8d0ca8c","observation_id":"90a75562-a2e8-494d-8a15-9392fa7bb123","resolution":{"observed_at":"2026-08-06T04:19:53.771485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-07T20:15:14.692955Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05967","last_updated":"2026-08-06T12:44:35Z","snapshot_observed_at":"2026-08-10T18:58:00.885170Z","submitted_at":"2026-08-06T12:44:35Z","title":"M$^3$Prune: Hierarchical Collaborative Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T20:15:14.692955Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2608.05967"},"observation_digest":"sha256:85da4475684fa8759bed5d3848b3ea99396466eae205ed81106ae2737b06e4dd","observation_id":"5069e662-c10a-44cf-aef2-4d67d23e3bcf","resolution":{"observed_at":"2026-08-07T20:15:14.692955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15041/citation-record","integrity":"/paper/2411.15041/integrity","json":"/paper/2411.15041/citation-record.json","paper":"/paper/2411.15041"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:38:17.146461Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.146461Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:1d8d58a0338e15b36f001f1615ae012952a8f13197bce84ecadae1b2a27d3ceb","observation_id":"a3c20d6e-0cef-44fb-9997-70b5f8f5731a","resolution":{"observed_at":"2026-08-12T14:38:17.146461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.151337Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.151337Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:1732906514211db97e340fd8b916c1ca7039c78cd35efcef16db9a060edc8d6b","observation_id":"f3e98cd8-a5fa-430a-a368-41bbf5c112d8","resolution":{"observed_at":"2026-08-12T14:38:17.151337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:18.081103Z","title":"How (not) to ensemble lvlms for vqa","venue":null,"work_id":"4faa2bcf-9d89-47b8-8f7c-da8f4607d86b","year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.155855Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:5908f0cadab1a1b41bf50768565453ec901cdfb06a2949be4b7e822d980dfe1d","observation_id":"ce40568f-fb40-46f3-bd33-f3628fb91f7b","resolution":{"observed_at":"2026-08-12T14:38:18.085712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-08-12T20:38:07.563701Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11511","snapshot_observed_at":"2026-08-12T14:38:17.160452Z","title":"Self-rag: Learning to retrieve, gen- erate, and critique through self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.160452Z"},"links":{"cited_paper":"/paper/2310.11511","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:9b7d6bb7fe01c8e5e4bba193a3f580cfbc68dee0aa2125dbab52c006fb482366","observation_id":"a9cd680d-0338-445a-b3c8-20ec4459d95c","resolution":{"observed_at":"2026-08-12T14:38:17.160452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.165435Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.165435Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:ceb5939da5892aadf8c3f654dd9dedd271c1e238a6007555459eeb0e83c4f9b8","observation_id":"55e2dce2-3ece-4590-a49a-b6e76ad78783","resolution":{"observed_at":"2026-08-12T14:38:17.165435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07654","last_updated":"2022-10-26T10:47:17Z","snapshot_observed_at":"2026-08-08T13:24:21.373434Z","submitted_at":"2022-02-15T18:53:58Z","title":"Tomayto, Tomahto. Beyond Token-level Answer Equivalence for Question Answering Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07654","snapshot_observed_at":"2026-08-12T14:38:17.169982Z","title":"Tomayto, tomahto","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.169982Z"},"links":{"cited_paper":"/paper/2202.07654","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:1b0fb77f3841452e93cacefe3031fadd618d19a60ffce1b8f80db8841a4f6af8","observation_id":"ab987f6a-2223-47f6-87a1-8aa7816ad245","resolution":{"observed_at":"2026-08-12T14:38:17.169982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15406","last_updated":"2024-05-22T07:15:18Z","snapshot_observed_at":"2026-08-13T00:23:34.497384Z","submitted_at":"2024-04-23T18:00:09Z","title":"Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15406","snapshot_observed_at":"2026-08-12T14:38:17.174603Z","title":"Wiki-llava: Hierarchical retrieval-augmented generation for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.174603Z"},"links":{"cited_paper":"/paper/2404.15406","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:965c52f2ac549dd72956671f9c0cfa6e346ff781810a29d14181350c42d457d8","observation_id":"f8bd7257-79aa-49d1-8937-302667a75f10","resolution":{"observed_at":"2026-08-12T14:38:17.174603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05465","last_updated":"2024-10-14T13:11:55Z","snapshot_observed_at":"2026-08-13T13:09:48.458478Z","submitted_at":"2024-04-08T12:43:32Z","title":"HAMMR: HierArchical MultiModal React agents for generic VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05465","snapshot_observed_at":"2026-08-12T14:38:17.179802Z","title":"Hammr: Hierar- chical multimodal react agents for generic vqa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.179802Z"},"links":{"cited_paper":"/paper/2404.05465","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:95a8356da62757d9ea6c8647c09ebef819e2d9526d0b1c64c9f02bd532374b75","observation_id":"05816e27-ebaf-40ab-bc50-8651b3e077f3","resolution":{"observed_at":"2026-08-12T14:38:17.179802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:18.057461Z","title":null,"venue":null,"work_id":"7fcc3908-4ed9-4249-9a91-2efff5d4b057","year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.184256Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:83abaf5d664c8a319d510f3e4e1c8b6ba4e086c7870759ce6e32789e156c1a3d","observation_id":"4456f969-36bb-42d6-bff1-e8eb665d2c03","resolution":{"observed_at":"2026-08-12T14:38:18.062083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.188318Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.188318Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:2c6668e20850cc1f0f28db21987a40d5920ab5c66e8b930ee5df1e5e5f66b3a6","observation_id":"f5b49162-afcd-44d6-a54e-7528494e9e16","resolution":{"observed_at":"2026-08-12T14:38:17.188318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:18.033476Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"2bc2b42c-c66d-4da1-b2e7-85e15fe57d46","year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.192424Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:b51d7d39df2a816847c02015dacc16e6344114b9f858f9e6b085d1cfbd04bbde","observation_id":"8f572509-f4cc-4bf5-b363-6fa4b24d8456","resolution":{"observed_at":"2026-08-12T14:38:18.038162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.196574Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.196574Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:13007f78530c420f1aeb751722befc2097e3bb1fce74c6db8c76b6e9d053b89f","observation_id":"30a3ebf1-d3f3-45af-a0d6-408d6535ba4e","resolution":{"observed_at":"2026-08-12T14:38:17.196574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.200643Z","title":"Mme: A comprehen- sive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.200643Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:297c7d9883c5f9276eef2686ee45c355946bfcbdeba8388aadd4eb49eae1494b","observation_id":"673e03eb-afc0-4d32-8506-58860c4bf8e4","resolution":{"observed_at":"2026-08-12T14:38:17.200643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-12T14:38:17.204767Z","title":"Retrieval- augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.204767Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:8ab768887bc90a67929a8d1ebb0f3d5e7a7dabf9e4ee5e830fccee63b4c02ca8","observation_id":"aba424c8-e18c-499d-918c-359ad92bb8e5","resolution":{"observed_at":"2026-08-12T14:38:17.204767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:18.001438Z","title":"Unsupervised dense information retrieval with contrastive learning","venue":null,"work_id":"56447455-b296-4863-8a08-3ec27536c70a","year":2022},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.209217Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:a29b8a61faf2069a2ccc5397034578ab8bf52587484c46eb222e97c36544b0dd","observation_id":"95a2d3b3-ba18-42eb-828b-2ba12a776ae3","resolution":{"observed_at":"2026-08-12T14:38:18.005987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.988160Z","title":"Google Lens","venue":null,"work_id":"7a7c3070-04ed-4dbf-a1df-2c57a10fd94b","year":2017},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.213191Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:0b3a3ee49c435301bef6e8cd721a66dc00620151441fb4eba3bba767c79cc38c","observation_id":"1c128526-bf95-489a-b750-8f142da0b5de","resolution":{"observed_at":"2026-08-12T14:38:17.992389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.974553Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"cd3a0416-6e7d-4acf-810a-3adbf524f7d6","year":2017},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.217344Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:409b1dcc936cf09358549c504aa9ec004fcfbf729f931b0fa3ca5f959e9aa5d7","observation_id":"adf40151-1bb2-483e-bd5e-e5fda5a8960f","resolution":{"observed_at":"2026-08-12T14:38:17.979117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.959167Z","title":"Avis: Autonomous visual information seeking with large language model agent","venue":null,"work_id":"992a09f5-2c9a-49d2-9232-ec610d25f037","year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.221519Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:d3b5bedb9123774a405d41a9fcc1e57edf3fdf77e720d679d78c6669a6efe7a8","observation_id":"09d5a0c2-3288-431e-9729-1e09661e371a","resolution":{"observed_at":"2026-08-12T14:38:17.964047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.944786Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"dc87d621-949b-4df3-bc52-69ce2a0e936e","year":2019},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.226196Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:6246e118ebc6113193668ab8e6b02c80b3938913cc041fc4f36fe6f056304abf","observation_id":"2a4e55f7-27bf-4cec-88b8-353650d42865","resolution":{"observed_at":"2026-08-12T14:38:17.949606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.929703Z","title":"Large language models know what is key visual entity: An llm-assisted multi- modal retrieval for vqa","venue":null,"work_id":"37a350e9-dcbc-40a1-9e80-21fc26019cd6","year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.230295Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:42c2a5137d8ef44350b3a5c004511a0a0349d2e2ddeb966da162fe40d77721f5","observation_id":"f1fe4afb-78e8-477a-b052-f863e3ac0d39","resolution":{"observed_at":"2026-08-12T14:38:17.934152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.915700Z","title":"Large language models struggle to learn long-tail knowledge","venue":null,"work_id":"18855bbc-3335-4ba1-a93a-03367fd1c3e9","year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.234502Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:358fb700c6d2b2870b009cad299cc802e19f9efaa6561575a9371af55521f0fc","observation_id":"730f4c11-163c-4f86-b3fe-2ccf551349d7","resolution":{"observed_at":"2026-08-12T14:38:17.920445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.901886Z","title":"Natu- ral questions: a benchmark for question answering research","venue":null,"work_id":"384bf373-b973-40af-a912-c4f739aede6c","year":2019},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.238466Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:edf3f24e50a54a24310850edbb147c68396c88e2aad0fdd00369ff5d557e16e8","observation_id":"3e1c9ab7-9076-457c-9abd-6045024c5b39","resolution":{"observed_at":"2026-08-12T14:38:17.906411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.887741Z","title":"Viquae, a dataset for knowledge-based vi- sual question answering about named entities","venue":null,"work_id":"9dc680c1-0fff-4bdc-9cd4-d8a37b5acb1e","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.242588Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:17421078f2b613169d84f92003d8e25c3566ba6c15dd5a1c1c0ea853cc3af228","observation_id":"fab9994a-ec10-4510-82b2-1b3bde0813e1","resolution":{"observed_at":"2026-08-12T14:38:17.892269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.873348Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"6af33100-b885-443d-8c6b-3a7074c02690","year":2020},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.246759Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:d3c657b62d40c372a4ded338b59a7726b7f0ea458cea1b0c1a104f0649eafd7a","observation_id":"eb30ec1a-a9ad-4225-98b7-bea6d7090a45","resolution":{"observed_at":"2026-08-12T14:38:17.878452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T14:38:17.250707Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.250707Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:a5de3bacdb73f3e216cec67bbe08fd6332b9585ef49203e29dc94cfda7a8c36a","observation_id":"33fa80b8-2a9c-44a4-abf5-b9e03dba5dfe","resolution":{"observed_at":"2026-08-12T14:38:17.250707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.254872Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.254872Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:253c4199c8d44654a5709cee62070167b119ea38e0b40d70c4a3925583105682","observation_id":"75c1788c-a275-45d5-93fd-5f795fc7ac9c","resolution":{"observed_at":"2026-08-12T14:38:17.254872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T14:38:17.259644Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.259644Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:a475ba95949586a748ff4cff760cd0ac262272a714fbf6be15db46827577ddc9","observation_id":"82d6670f-8a86-46e4-ac20-801d53503970","resolution":{"observed_at":"2026-08-12T14:38:17.259644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-12T14:38:17.264576Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.264576Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:2254d89331cdb44a9ec26cd86c0a217315117d2a798b89d98f4b4d29a391b721","observation_id":"d61a41e1-dd37-47fd-9fc7-d72a0ec50854","resolution":{"observed_at":"2026-08-12T14:38:17.264576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T14:38:17.269363Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.269363Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:1e1de8fa04ab6cbb568cfd6125077a635d5febf4aa8ae273e6859e62f44af603","observation_id":"94f3a57e-df3f-4218-bff7-1ec5b6f6ec63","resolution":{"observed_at":"2026-08-12T14:38:17.269363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.851022Z","title":"Visual instruction tuning","venue":null,"work_id":"1f808104-ec48-49d2-89f0-ad36017abcba","year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.274343Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:da00345ae7281504dab95e4f0fb3c48c138eb200b39b7042daccc1898b397c39","observation_id":"07b85807-d788-4967-bce3-aa91d8aeec63","resolution":{"observed_at":"2026-08-12T14:38:17.855345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.278346Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.278346Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:7b07a9b882606da0cdb40f8c4166e2f42f52c31f7875d1a267639ba4f9151a53","observation_id":"a67bb6ea-8908-489e-8bb8-49f90053ca85","resolution":{"observed_at":"2026-08-12T14:38:17.278346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.08553","last_updated":"2021-08-06T20:35:50Z","snapshot_observed_at":"2026-08-13T01:09:24.084784Z","submitted_at":"2020-09-17T23:08:01Z","title":"Generation-Augmented Retrieval for Open-domain Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.08553","snapshot_observed_at":"2026-08-12T14:38:17.282351Z","title":"Generation- augmented retrieval for open-domain question answering","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.282351Z"},"links":{"cited_paper":"/paper/2009.08553","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:097154d7377174fbb4503c0294600dcdedec90bf76449c4c35a7e090bf34f7c7","observation_id":"64c369a7-86bc-4731-8268-e636b720a62c","resolution":{"observed_at":"2026-08-12T14:38:17.282351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.286631Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.286631Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:46365416a9f69b28c8c0b8ac7d5a627a21dc7dd1d2e9f8630db52b4a070fe98b","observation_id":"4ec920ac-0f10-4557-a05b-cc7baf6d880d","resolution":{"observed_at":"2026-08-12T14:38:17.286631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.819104Z","title":"Sfrembedding-mistral: en- hance text retrieval with transfer learning","venue":null,"work_id":"3d1aee69-3046-46bc-b9a7-0865ad33ffa7","year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.290736Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:edd87f02fcc4fba99dd83c7831a18dbeb777f1c247208710ec2a78875679a85f","observation_id":"d6b2b1a5-9b93-4f81-828a-6ba4f13f0e2d","resolution":{"observed_at":"2026-08-12T14:38:17.823573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.805402Z","title":"Encyclopedic vqa: Visual questions about detailed properties of fine-grained categories","venue":null,"work_id":"82de6ca4-9ab1-4efc-bd40-e50258a85f6c","year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.295096Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:deac7358976d0f82d08a069ab0e224d9e12fdbcf7d3904078ef24648f2d079a6","observation_id":"173500e1-cc88-4fdf-8289-2ebb48f75c30","resolution":{"observed_at":"2026-08-12T14:38:17.810059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.791720Z","title":"Plotqa: Reasoning over scientific plots","venue":null,"work_id":"75f83bac-b2c7-4cca-aa31-8116485ec73a","year":2020},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.299590Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:e323c391bcdce432bb8a43d1a4fdbef2f360a2d9c8463bdd9ae7f951c4d1b015","observation_id":"dc030e7e-2e92-4eb0-b906-5a824726877c","resolution":{"observed_at":"2026-08-12T14:38:17.796082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.778399Z","title":"Introducing gpt-4o: Openai’s new flagship multi- modal model now in preview on azure","venue":null,"work_id":"7e71a934-2605-4bc8-a85d-a1cdeb90d763","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.303681Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:42cc230569bb6245f68445f06ca40fdd6aa5fb30b7575455bc6ec89da5d5ae00","observation_id":"737fee84-f23b-4adc-9cc4-9e3f14310b4c","resolution":{"observed_at":"2026-08-12T14:38:17.782797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.312457Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.312457Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:b503f791f031b9ba9f226a1ee636fb57802e14b8765d16a0fd8468691a6f4b3f","observation_id":"c966edb7-4ef3-4e87-823e-60358f81d130","resolution":{"observed_at":"2026-08-12T14:38:17.312457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.316597Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.316597Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:97f3819e2c8e766017f35c3f22761995102fdffd314599bfbea3f52435d2dffe","observation_id":"e46fa1f1-e8bf-43cd-a5d3-efb44235add8","resolution":{"observed_at":"2026-08-12T14:38:17.316597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T14:38:17.320542Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.320542Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:96c2cc3f6c69fdda8e4dc074bddef2a2f888cf6a280f00a4498031b71d7f976a","observation_id":"2b6fbaac-fb38-44fc-b880-d4029cd38b65","resolution":{"observed_at":"2026-08-12T14:38:17.320542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.733412Z","title":"A-okvqa: A bench- mark for visual question answering using world knowledge","venue":null,"work_id":"4918bace-a5e4-474f-9495-95ff24d4937a","year":2022},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.324856Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:eecb3e79eb61cc5b8e2c110e4f696a0f78d2e1e0ed7d8f5716431c8c06a04cb8","observation_id":"42695280-89aa-46a7-8183-ddad4e68803b","resolution":{"observed_at":"2026-08-12T14:38:17.737761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.719887Z","title":"10 Towards vqa models that can read","venue":null,"work_id":"d7112725-3210-4f87-b18e-dd7d7e709383","year":2019},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.329098Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:3d284310d36d74bd78de046f3e3c52dee4d9132da4685d06f9e330b38cacc05f","observation_id":"4e0e30aa-0bd6-48ae-a0fa-86515c51ca48","resolution":{"observed_at":"2026-08-12T14:38:17.724361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T14:38:17.333113Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.333113Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:6fc6749a616a2a3cf843832d9aacb135187264781d87001366c371841c2a947e","observation_id":"cc427235-2777-4bb9-92cf-7607e25faa02","resolution":{"observed_at":"2026-08-12T14:38:17.333113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.337437Z","title":"Chain-of- thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.337437Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:c5c2f59f57f2586416d568cfa960d3b8e4dfe47b7a71dccee0ee24509d481161","observation_id":"af0c4a4e-6778-470a-98fe-4985de76c81f","resolution":{"observed_at":"2026-08-12T14:38:17.337437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12735","last_updated":"2024-12-02T02:34:47Z","snapshot_observed_at":"2026-08-13T09:06:07.478621Z","submitted_at":"2024-07-17T16:55:42Z","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12735","snapshot_observed_at":"2026-08-12T14:38:17.341496Z","title":"Echosight: Advancing visual- language models with wiki knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.341496Z"},"links":{"cited_paper":"/paper/2407.12735","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:78c6c78abd2a8d9bcef0ea2255e9fb8d673a94b412b2f8801d6277c81f856104","observation_id":"146dde20-b8bf-41c3-89fc-f4edabb449a5","resolution":{"observed_at":"2026-08-12T14:38:17.341496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-12T14:38:17.345942Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.345942Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:2c0119ac6f33d0c2baeb31bd13dad1b4aeac9846327314c578f4f38f06a63c10","observation_id":"b120ab8b-6f06-4302-8517-6a6b428ff9fd","resolution":{"observed_at":"2026-08-12T14:38:17.345942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-12T14:38:17.350239Z","title":"Siren’s song in the ai ocean: A survey on halluci- nation in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.350239Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:bcbcfb968d862816e1a73b6498981f07269820d9e49aa51f582b4324b12dca58","observation_id":"a10c10ec-bcec-43e6-86e9-a4a05af3e670","resolution":{"observed_at":"2026-08-12T14:38:17.350239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.696727Z","title":"Mipha: A comprehensive overhaul of multimodal assistant with small language models","venue":null,"work_id":"94c48288-e18a-482a-a4c5-f2f506ccce14","year":2024},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.354552Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:fdc93b31169435ee2cdb1da2cbfd76e81937ad4d9b3bd0485ba28f43788ebddf","observation_id":"33ba0bbd-e8b4-4299-ae6a-7c116f5814f7","resolution":{"observed_at":"2026-08-12T14:38:17.701236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.682184Z","title":null,"venue":null,"work_id":"ed0aa597-417d-4daf-85d8-9b924211c934","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.358544Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:b6256b8bff3c208ecddd8c98c38a0bf6e1b8f72b6889d25ecf4b6309b184787c","observation_id":"513aa7f6-e4a0-4a5b-8802-95233b90f341","resolution":{"observed_at":"2026-08-12T14:38:17.686628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.668276Z","title":null,"venue":null,"work_id":"fe37189b-b4f3-4d38-90ef-c5398468c289","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.362733Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:53d626cff7b75b16ed8746e281042eefb649a28a8f202ae0e21c0c4c8a192a8a","observation_id":"15f19c85-2bb9-40f4-8df8-6d3cc4ba2661","resolution":{"observed_at":"2026-08-12T14:38:17.672710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.653731Z","title":"Answer: {answer}","venue":null,"work_id":"e4e2275f-41b1-4469-8889-42d4c76339d5","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.366776Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:107fa6022301e3fe579730acff94e62cd069a00bdc6a037ea15796d09ba81303","observation_id":"8c34f509-06b4-4e36-b36e-383fb428a735","resolution":{"observed_at":"2026-08-12T14:38:17.658988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.639147Z","title":"In the without external knowledge setting, the model relies solely on the knowledge encoded in its parameters to answer ques- tions","venue":null,"work_id":"1b4ff94d-c53e-4bec-90b2-1eefc21423e4","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.370966Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:ebb85c8dbfff8ff74d23151db83f7c0b640cdc31450e76c9869d648f87218f10","observation_id":"4301decd-d900-47f6-b12e-3248c3fe3575","resolution":{"observed_at":"2026-08-12T14:38:17.644317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.624107Z","title":null,"venue":null,"work_id":"81ee025e-1709-4314-8cbd-dfc0c343af9a","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.374945Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:7f37d76cfe4ab56afdc57a2647a72fa482ee856698a4e83ba79de36885c62a9c","observation_id":"363e23a3-a50b-4f1b-bb68-8e4e2b6cc397","resolution":{"observed_at":"2026-08-12T14:38:17.629388Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:17.764282Z","title":null,"venue":null,"work_id":"e84fc7d8-671f-4bce-8b72-63c8300e8740","year":null},"citing_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:17.307785Z"},"links":{"citing_paper":"/paper/2411.15041"},"observation_digest":"sha256:1bfe0b6df9d778de5da058b5f59f533489d6b77620d05f03ef4f3201a8c40b28","observation_id":"e7b48f32-9350-49a3-915b-251fc9205009","resolution":{"observed_at":"2026-08-12T14:38:17.769315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T16:26:54.367458Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 16 inbound Pith citation observations for arXiv:2411.15041."}