{"as_of":"2026-08-09T18:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8de9ce78f34aa15d4fa86217f4f1ba6d81b91be0fe64a599a5d85ca274538e08","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:40:45.271374Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:26:30.298761Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T06:11:03.314967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":"2510.09733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.09733","snapshot_observed_at":"2026-07-29T02:25:09.242061Z","title":null,"venue":null,"work_id":"18a42548-77ee-4736-bd55-1cefba9dbd94","year":2025},"citing_paper":{"arxiv_id":"2604.09508","last_updated":"2026-04-10T17:25:34Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T17:25:34Z","title":"VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:21.088097Z"},"links":{"cited_paper":"/paper/2510.09733","citing_paper":"/paper/2604.09508"},"observation_digest":"sha256:41eb4a4ceb04deb28d0cedc51c14af5490a53c816ba06349dd99978eaeae605d","observation_id":"8314f735-3cd5-4026-a69b-37eb60ce1769","resolution":{"observed_at":"2026-07-29T02:25:09.242061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09733","snapshot_observed_at":"2026-08-02T13:26:30.298761Z","title":"acl-long.1166/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24748","last_updated":"2026-05-21T13:33:38Z","snapshot_observed_at":"2026-08-08T05:28:48.213796Z","submitted_at":"2026-05-21T13:33:38Z","title":"VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents","version":1},"reference_index":1166,"source":"pdf_text","source_observed_at":"2026-08-02T13:26:30.298761Z"},"links":{"cited_paper":"/paper/2510.09733","citing_paper":"/paper/2607.24748"},"observation_digest":"sha256:74dac2123ce5062009ac1b6b3d9a5d3899777c27f0a9b0d1e6b364dd8301f527","observation_id":"c5b73bbf-e22c-4165-9cb5-f1312655973b","resolution":{"observed_at":"2026-08-02T13:26:30.298761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09733","snapshot_observed_at":"2026-07-31T00:05:16.817803Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25151","last_updated":"2026-07-27T23:50:46Z","snapshot_observed_at":"2026-08-06T12:12:05.597891Z","submitted_at":"2026-07-27T23:50:46Z","title":"HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:16.817803Z"},"links":{"cited_paper":"/paper/2510.09733","citing_paper":"/paper/2607.25151"},"observation_digest":"sha256:cd6bcee720939e7d5c3dc870ed2224b0cdb8d96ec92df718e1bad11c9d97295a","observation_id":"0c1c64e5-43e1-4b3d-936e-77c1ad65fa16","resolution":{"observed_at":"2026-07-31T00:05:16.817803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.09733/citation-record","integrity":"/paper/2510.09733/integrity","json":"/paper/2510.09733/citation-record.json","paper":"/paper/2510.09733"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-04T10:40:40.003421Z","title":"Openvlthinker: An early exploration to complex vision-language reasoning via iterative self-improvement.CoRR, abs/2503.17352,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.003421Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:cb90f4dca9a0e7c0a9f4c8ee3170bd417dfc5a63c703dfdc5bc0f303172b9d1c","observation_id":"0f676318-d5c5-4301-b671-27ab49a04525","resolution":{"observed_at":"2026-08-04T10:40:40.003421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-04T10:40:40.158449Z","title":"Colpali: Efficient document retrieval with vision language models.CoRR, abs/2407.01449,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.158449Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:72997f8fdf016ab807e1c860b03513f1c06781e9fcd38144258cfc3276be0d2e","observation_id":"13273786-95f4-447f-b371-5cd1191bf618","resolution":{"observed_at":"2026-08-04T10:40:40.158449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T10:40:40.340433Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.CoRR, abs/2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.340433Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:3e934080f7f6c5b5ef647e09205622438769319206c0f33c2d0e3b25b7f3d57e","observation_id":"18f4960a-efbd-4a31-8668-efc10eade051","resolution":{"observed_at":"2026-08-04T10:40:40.340433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:40.397585Z","title":"Sufficient context: A new lens on retrieval augmented generation systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.397585Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:142fc8377a24359c569f8c88367858368258bc5dfeeb8a726148ab1e325dfd31","observation_id":"db067711-b5e6-41fa-8bca-fe48a7ebde2d","resolution":{"observed_at":"2026-08-04T10:40:40.397585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:40.511860Z","title":"Retrieval-augmented gener- ation for knowledge-intensive NLP tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.511860Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:f35d2668184de9aa106d0c1f8a079b65312382723b8178e9bb07d51839b3ba11","observation_id":"6b112fef-c78b-471e-a5ac-e9abc202bd2f","resolution":{"observed_at":"2026-08-04T10:40:40.511860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21523","last_updated":"2025-06-20T08:41:41Z","snapshot_observed_at":"2026-08-08T02:35:34.040619Z","submitted_at":"2025-05-23T05:08:40Z","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21523","snapshot_observed_at":"2026-08-04T10:40:40.740096Z","title":"Chengzhi Liu, Zhongxing Xu, Qingyue Wei, Juncheng Wu, James Zou, Xin Eric Wang, Yuyin Zhou, and Sheng Liu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.740096Z"},"links":{"cited_paper":"/paper/2505.21523","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:34a2b990b7dcc5839ebad76d7d37619d1f1fba4d8faca6a0c01049020477d74f","observation_id":"dc1e5cb2-075b-41e1-b5c1-d43d63842083","resolution":{"observed_at":"2026-08-04T10:40:40.740096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:40.812295Z","title":"MMLONGBENCH-DOC: benchmarking long-context document understanding with visualizations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.812295Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:0b1fcc47899e26be5f4e2ada7da31b556f577c5bdb84aef7240f3eb6f90ec332","observation_id":"a1af78be-1a98-4ab4-9aa8-268e8e5f965b","resolution":{"observed_at":"2026-08-04T10:40:40.812295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:40.888511Z","title":"Chartqa: A bench- mark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.888511Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:6ed916a1d968aa74b56ef5f4d89a0de6bf16956d6c2ab28c7b59fe70bf4398d6","observation_id":"2bbdaa40-42cb-4216-9af5-abf927a224a0","resolution":{"observed_at":"2026-08-04T10:40:40.888511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-04T10:40:41.087844Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning.CoRR, abs/2503.07365,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.087844Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:6eb50f4c0215ee23d616ad9a00401289f80112d4f7ac39b902876bc7714d20f6","observation_id":"52aa5362-0795-4a85-8fe7-7dc7265b75d2","resolution":{"observed_at":"2026-08-04T10:40:41.087844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:41.185656Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.185656Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:586367a438e2818d3963997d91be44083d9165f09daad7c089c4456a356e5abc","observation_id":"dc0df9de-a0b7-4b51-b1f2-12b2f71ac1f1","resolution":{"observed_at":"2026-08-04T10:40:41.185656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22095","last_updated":"2026-04-06T12:52:40Z","snapshot_observed_at":"2026-08-02T15:44:17.473900Z","submitted_at":"2025-05-28T08:17:57Z","title":"Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22095","snapshot_observed_at":"2026-08-04T10:40:41.255247Z","title":"Learning to route queries across knowledge bases for step-wise retrieval- augmented reasoning.CoRR, abs/2505.22095,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.255247Z"},"links":{"cited_paper":"/paper/2505.22095","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:6240cc9091fe7a8d557693ff466409e619e7f7ed14ce03924f4f46c979ae3469","observation_id":"7dd9a68c-cf7a-486b-a568-c69818d463ae","resolution":{"observed_at":"2026-08-04T10:40:41.255247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:41.370251Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.370251Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:81143930239f0a6a1e1a98c132c9430813a3ee0b5fd252e1ab20ba3112f6c9b4","observation_id":"7bf37899-8192-4252-b32b-46004f9abf72","resolution":{"observed_at":"2026-08-04T10:40:41.370251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T10:40:41.865785Z","title":"VLM-R1: A stable and generalizable r1-style large vision-language model.CoRR, abs/2504.07615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.865785Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:e7c5373da4617c22086332f4996bbaf862d6a74b55f6a4d50d11c30d27f08e22","observation_id":"50481eac-6e75-479f-bb53-dabbba35c617","resolution":{"observed_at":"2026-08-04T10:40:41.865785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-04T10:40:42.001140Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning.CoRR, abs/2503.05592,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.001140Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:68810377a314e95aa0664be511c655a8f34df825ab45e9e63416d20f3c05ca61","observation_id":"b894b856-43a3-4224-b398-0ba3694c7389","resolution":{"observed_at":"2026-08-04T10:40:42.001140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:42.115895Z","title":"Slidevqa: A dataset for document visual question answering on multiple images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.115895Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:cd16d4b9f98d1f4c58fc8584742f14a5f1b810f553497a5de2be8ac54c889c52","observation_id":"89dc95ed-2c01-4b09-84bc-c5f9d8f5d052","resolution":{"observed_at":"2026-08-04T10:40:42.115895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18017","last_updated":"2025-06-03T05:34:30Z","snapshot_observed_at":"2026-08-07T17:50:42.770308Z","submitted_at":"2025-02-25T09:26:12Z","title":"ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18017","snapshot_observed_at":"2026-08-04T10:40:42.255954Z","title":"Vidorag: Visual document retrieval-augmented generation via dynamic iterative reasoning agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.255954Z"},"links":{"cited_paper":"/paper/2502.18017","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:d9fd18006b92678e9e9c2779796aa24dde7b6e53edc526db100a0238824a600b","observation_id":"52d1dcbe-62e6-40ed-b846-3e4e07250478","resolution":{"observed_at":"2026-08-04T10:40:42.255954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-08-04T10:40:42.435539Z","title":"Mmsearch- r1: Incentivizing lmms to search.CoRR, abs/2506.20670,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.435539Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:1b22e04534f9061e08421b7da56e240ed84f7f7f3295088fe6b0d41818b50d2f","observation_id":"cd68caac-9f0d-4ae3-90d8-da8961af88f8","resolution":{"observed_at":"2026-08-04T10:40:42.435539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-04T10:40:42.595790Z","title":"Shilin Xu, Yanwei Li, Rui Yang, Tao Zhang, Yueyi Sun, Wei Chow, Linfeng Li, Hang Song, Qi Xu, Yunhai Tong, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.595790Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:b8882f3003f0d2f1ba3be27c738bfaa55aa5f782a8590bc0bfcb9ef36979883e","observation_id":"f71a09d5-6d54-4b7c-8b97-ee11e5773ca8","resolution":{"observed_at":"2026-08-04T10:40:42.595790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:42.850592Z","title":"Visrag: Vision-based retrieval-augmented generation on multi- modality documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.850592Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:15d84fdbd3736b85c944c1fd4cfd94aca82927293390a3181d5b8d1ab1de1551","observation_id":"2def8d7a-dddd-4ee8-9c4d-dc480f652b25","resolution":{"observed_at":"2026-08-04T10:40:42.850592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-04T10:40:42.936784Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning.CoRR, abs/2503.18013,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.936784Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:39a7e6bc200e16f274309bea5d4b55eb269cbf9cf90c4839c6fc6a4609f82190","observation_id":"b41ac04a-da97-4869-a536-9d821f622145","resolution":{"observed_at":"2026-08-04T10:40:42.936784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-08-09T16:57:52.708316Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-04T10:40:43.075026Z","title":"Cocot: Contrastive chain-of-thought prompting for large multimodal models with multiple image inputs.CoRR, abs/2401.02582, 2024a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:43.075026Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:ffb67730d1bc7708babe767048f6ab2fc8dfaacb34fa3254f68a0d163c44e5e3","observation_id":"cd670699-7307-452d-85fd-260683163256","resolution":{"observed_at":"2026-08-04T10:40:43.075026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-04T10:40:43.207178Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models.CoRR, abs/2403.13372,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:43.207178Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:6ea8d4d61909b95b148bf3747415972df88b299f6fec16346105faa65055133e","observation_id":"375cf03b-0826-4779-8034-58bf37bed387","resolution":{"observed_at":"2026-08-04T10:40:43.207178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:43.381867Z","title":"Each dataset provides ground-truth answer image IDs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:43.381867Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:75b595b979200e9d0c80a92d30b90bac22913dff7637bd084a50aa79cc281652","observation_id":"c6b1a08a-4ce9-46ab-b18e-edb10fcb4c80","resolution":{"observed_at":"2026-08-04T10:40:43.381867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:43.560240Z","title":"During the retrieval stage, VisRAG-Ret retrieves the top five can- didate images for each query","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:43.560240Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:15d5cad8af93f1611ca3f66b3a60ba951851b8dc8bf9ce437456880003a44adc","observation_id":"b4443730-2d6f-4012-8e8a-009db839392a","resolution":{"observed_at":"2026-08-04T10:40:43.560240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:43.728043Z","title":"aha moments","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:43.728043Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:bccbbfd02f6696cf8acc0ca5f2759d97a533e19cf0cdaf6eb1381aa4bbf4ea2c","observation_id":"d16caa28-0fc5-4fea-a0be-c7bbb885efbe","resolution":{"observed_at":"2026-08-04T10:40:43.728043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:43.914660Z","title":"General VLMs.We assessed general vision-language models across different scales, namely Qwen2.5-VL-7B and Qwen2.5-VL-32B (Bai et al., 2025), as well as MiMo-VL-7B-RL (Xiaomi, 2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:43.914660Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:0b891f81a65dfcfe2db331d1d76b97adc2e49316ae6cffc519705fc733695c3d","observation_id":"9d8ed55e-988c-4eef-90c3-d35a44a09daf","resolution":{"observed_at":"2026-08-04T10:40:43.914660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.070405Z","title":"Why Young Americans are Driving So Much Less Than Their Parents","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:44.070405Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:654ef7271cfd412e086d74e59d8ff9dffdadf76ebcbc6940bbc2da7fda3214e5","observation_id":"92965a41-cff5-4a4c-a3a4-f2e16949db08","resolution":{"observed_at":"2026-08-04T10:40:44.070405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.588079Z","title":"This image contains the information needed to identify the country and its major languages.Image 2 is the China Fact Sheet","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:44.588079Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:06992d09d4940d7a873d0b794503e4ce604b1a0e8ea69a397e1e4ea82a99d219","observation_id":"41a13791-1866-43c8-a364-ace509891717","resolution":{"observed_at":"2026-08-04T10:40:44.588079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.716986Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:44.716986Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:489f05fa9b4550f01975d8bd8ff4b8caca811eac49cf4a1af28d8020038f2f1b","observation_id":"6372b211-81ff-4845-95b4-c133ed76e65c","resolution":{"observed_at":"2026-08-04T10:40:44.716986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.859949Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:44.859949Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:7ef73f7a3c2af62125f50df899d8c329e8640ffa2496e3ee81237837f37f5785","observation_id":"bffc8a2f-b688-4e97-9854-2f432258b54f","resolution":{"observed_at":"2026-08-04T10:40:44.859949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:45.012731Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:45.012731Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:acca13bce28b983a224eff5f29b5b8b81695ce5183fef4815ebfcf577b72ee7d","observation_id":"6ee18de2-282a-4466-83d0-a5c95369e45e","resolution":{"observed_at":"2026-08-04T10:40:45.012731Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:45.142116Z","title":"These languages are Mandarin, Yue (Cantonese), Wu (Shanghainese), Minbei(Fuzhou), Minnan (Hokkien-Taiwanese), Xiang, and Gan","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:45.142116Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:83d89f652fc864d2854deaafd924701f4ca3da7646f0b2febad812982ef32473","observation_id":"ffc2d9ef-4a2a-4a8e-a209-4dd6e57e6e02","resolution":{"observed_at":"2026-08-04T10:40:45.142116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:45.271374Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:45.271374Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:770ae8bcd751cee6a4be6be542b91f4b3c291ce18bcd7ce0dd4c84ce2bf18403","observation_id":"e9c3c62b-efab-4f47-aa01-b93e1b0ed4d1","resolution":{"observed_at":"2026-08-04T10:40:45.271374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.384744Z","title":"yes\" or","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:44.384744Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:3b75adbb939e496600848fdf621680242a4ae62c115ac0801796a19754105359","observation_id":"ae741f1b-d388-4662-8b9b-1bc7054fd425","resolution":{"observed_at":"2026-08-04T10:40:44.384744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.210080Z","title":"Why Young Americans Are Driving So Much Less Than Their Parents","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:44.210080Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:9be2df4690893216dab4a7bfd3e31c024bde310ebe95ef86dbbfb3b236edc011","observation_id":"fe31c3db-833c-4e61-b948-75c84f96beb5","resolution":{"observed_at":"2026-08-04T10:40:44.210080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T10:40:41.676641Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.CoRR, abs/2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.676641Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:8cf5be17ea876e85695192c91747162e0a80851c4588f9a3fac4fd5b9f21b844","observation_id":"27b4a6d3-525d-4e6c-aa8a-d60657cf72bb","resolution":{"observed_at":"2026-08-04T10:40:41.676641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-04T10:40:40.583884Z","title":"Search-o1: Agentic search-enhanced large reasoning models.CoRR, abs/2501.05366,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.583884Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:b9d34df0f02d6e9b2c4e47c773975bb4a779a1c6db7ef4fff929d4870ead6370","observation_id":"4f9ef482-114f-4fb3-99e0-b3ffb326e293","resolution":{"observed_at":"2026-08-04T10:40:40.583884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:40.976385Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:40.976385Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:f4e19800ef37034668f6d9595d3673b1187fd13c8be6871f0fddf14481baf2f6","observation_id":"9b1dbc2d-de7f-4284-ae36-ce4007a7ac8c","resolution":{"observed_at":"2026-08-04T10:40:40.976385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T10:40:41.495917Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.495917Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:2b70cc9136e5a04250e99d26e754a9abf8307eda71033c4e048447173b7457ae","observation_id":"d9277bbb-9f91-4800-83d6-38035ce912e4","resolution":{"observed_at":"2026-08-04T10:40:41.495917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T10:40:39.822350Z","title":"Qwen2.5-vl technical report.CoRR, abs/2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:39.822350Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:c2f4d0476884de67e4cc30abaf43e3b1a478d8353a5648663e3e17f02802eef5","observation_id":"1a25c138-4432-4899-9b93-a37674037146","resolution":{"observed_at":"2026-08-04T10:40:39.822350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:39.676363Z","title":"github.io/blog/2025/Polaris","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:39.676363Z"},"links":{"citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:654568d4aed93e1ea6301b76ce0e2e96983b4a26e1a4856ce2d59bdf2049d538","observation_id":"3092fd19-e853-46fa-a63f-510b2ef40d08","resolution":{"observed_at":"2026-08-04T10:40:39.676363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2510.09733."}