{"as_of":"2026-08-07T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a15dcd05e0fd553b3f3bbd6b5cc1f8c493c9dcd6134180b113e54d092b486552","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:38:19.660978Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T23:51:47.724033Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"cited_work":{"arxiv_id":"2507.05056","doi":"10.48550/arxiv.2507.05056","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05056","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"doi:10.48550/arXiv.2507.05056 , abstract =","venue":null,"work_id":"17659760-7c13-4afc-bee2-54b4d53f4e6f","year":null},"citing_paper":{"arxiv_id":"2604.21027","last_updated":"2026-08-02T16:15:42Z","snapshot_observed_at":"2026-08-06T23:24:26.820832Z","submitted_at":"2026-04-22T19:18:36Z","title":"HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering","version":1},"reference_index":272,"source":"arxiv_source","source_observed_at":"2026-05-09T23:51:47.724033Z"},"links":{"cited_paper":"/paper/2507.05056","citing_paper":"/paper/2604.21027"},"observation_digest":"sha256:6890dee0a60b24f4f345b3d2c4dd2a5f9e5aef5e11962050d38b2cf5c8340ffd","observation_id":"77c88cd2-e7eb-4675-afed-c9d9752cefea","resolution":{"observed_at":"2026-05-09T23:54:45.759084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05056/citation-record","integrity":"/paper/2507.05056/integrity","json":"/paper/2507.05056/citation-record.json","paper":"/paper/2507.05056"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.12718","last_updated":"2025-03-14T04:38:44Z","snapshot_observed_at":"2026-07-06T18:33:02.286642Z","submitted_at":"2024-06-18T15:38:41Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12718","snapshot_observed_at":"2026-08-06T19:38:18.543645Z","title":"Agla: Mitigating object hallucinations in large vision- language models with assembly of global and local attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.543645Z"},"links":{"cited_paper":"/paper/2406.12718","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d9ec961bc0436c1815434bb49f4a4285c1350fe8415243ca4b9fc9df7c6ca323","observation_id":"cde163f2-8c77-43a1-b3cf-0994f4aace27","resolution":{"observed_at":"2026-08-06T19:38:18.543645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T19:38:18.641082Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.641082Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:7adf3dcbc8e833d721ff273d1c1c04085713cb1cf381e95909be8cd47451f064","observation_id":"a1fb25db-3cec-43ef-906f-8fc625f13c61","resolution":{"observed_at":"2026-08-06T19:38:18.641082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:38:18.738529Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.738529Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f18787d41431b9d6e2776ae610a181a07e804a1683cb703e6e3ba1782deb8d6e","observation_id":"32146d21-d3c0-49b7-836c-928f63a46e6b","resolution":{"observed_at":"2026-08-06T19:38:18.738529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:18.889260Z","title":"Audio chord recognition with recurrent neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.889260Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:b8cea99bd55b0fd41669e93ac2daf1bdd53da04c2fce1ac19fdde333b05f165a","observation_id":"abd1f3f1-8060-4670-9419-2bded2f1845b","resolution":{"observed_at":"2026-08-06T19:38:18.889260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.116024Z","title":"Explaining a series of models by propagating shapley values","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.116024Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8e098f187d442fb877bf903091966668baccc3b6926400c1dce833e8514c579a","observation_id":"a5f89206-c5b7-4a57-ae89-6a8068f7b646","resolution":{"observed_at":"2026-08-06T19:38:19.116024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01811","last_updated":"2023-12-01T12:27:10Z","snapshot_observed_at":"2026-08-03T13:15:08.099953Z","submitted_at":"2023-04-04T14:08:42Z","title":"HarsanyiNet: Computing Accurate Shapley Values in a Single Forward Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01811","snapshot_observed_at":"2026-08-06T19:38:19.235787Z","title":"Harsanyinet: Computing accurate shapley values in a single forward propagation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.235787Z"},"links":{"cited_paper":"/paper/2304.01811","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:82d5a71538eb94ba5b957259c1f3fb6738733ff276d848e60fd24c29a82e759a","observation_id":"14a3c217-acfc-41a1-9175-0c4b255ad614","resolution":{"observed_at":"2026-08-06T19:38:19.235787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T19:38:19.295473Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.295473Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5d6df455ecdb9377faf383756674fae49062540867d42cfaae7d17c181a05bad","observation_id":"4eec48b3-1663-4ede-a27a-99988b8e0564","resolution":{"observed_at":"2026-08-06T19:38:19.295473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16479","last_updated":"2023-11-27T09:30:02Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-27T09:30:02Z","title":"Mitigating Hallucination in Visual Language Models with Visual Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16479","snapshot_observed_at":"2026-08-06T19:38:19.305433Z","title":"Mitigating hallucination in visual language models with visual supervi- sion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.305433Z"},"links":{"cited_paper":"/paper/2311.16479","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:43007b113440adc1b52f5324e7b3c706b26428b473264b69e76b3a8e258ceac6","observation_id":"77c2f478-91d0-4563-8c17-358dd4ebcf98","resolution":{"observed_at":"2026-08-06T19:38:19.305433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T19:38:19.310549Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.310549Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8e516784f12e406cbb092868f248e22bc39cb026df7efe7899d4bbdfc136a6b6","observation_id":"b6e23cfd-04b9-40f6-b682-be1301f0a10e","resolution":{"observed_at":"2026-08-06T19:38:19.310549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.315314Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.315314Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:017febf180cfc2e4bf06cfe78f50165cb6dffce8d9e0e47a40ad7d7ef330ce5b","observation_id":"5adf8b47-d680-4fd8-9a0f-c9cb8648e60d","resolution":{"observed_at":"2026-08-06T19:38:19.315314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-07T09:16:51.378562Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-06T19:38:19.319571Z","title":"Halc: Object hallucination re- duction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.319571Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:153896339105080f8df7657ad8ef365ade502d1c0437356dc4dccd124c69dec0","observation_id":"bb014128-057b-4da0-accb-0fa9e84d5f85","resolution":{"observed_at":"2026-08-06T19:38:19.319571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.323992Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.323992Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:17bcb8f77034a2ee32ff75d571ac6fec9efff31deb4892429747a2e204151a60","observation_id":"27dec42c-0982-4fe4-8aea-80063af9da73","resolution":{"observed_at":"2026-08-06T19:38:19.323992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.328013Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.328013Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:4ee7857438a6a0050d7202368bf4a903ac81126cdf159d4d13eaed734615c3d0","observation_id":"9b05a7d3-e268-4b27-9fba-4d7c5a8afa63","resolution":{"observed_at":"2026-08-06T19:38:19.328013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06236","last_updated":"2022-11-07T16:47:51Z","snapshot_observed_at":"2026-08-02T21:42:59.900323Z","submitted_at":"2021-11-11T14:35:20Z","title":"Discovering and Explaining the Representation Bottleneck of DNNs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06236","snapshot_observed_at":"2026-08-06T19:38:19.336977Z","title":"Discovering and explaining the representation bottleneck of dnns","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.336977Z"},"links":{"cited_paper":"/paper/2111.06236","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8836deb78a6bb8ae169d81188c105311d56278d52aaac46a1c005ee64afd75a0","observation_id":"c9c02951-86d5-4b28-b4c6-f89920d25ef2","resolution":{"observed_at":"2026-08-06T19:38:19.336977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.342129Z","title":"Explaining deepfake detection by analysing im- age matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.342129Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:ecf7cd7894f83882bd41454a68c2ac00c5b8f9569cfea466ae4d84d13c2488e3","observation_id":"4a22e055-b58d-4069-afb2-7158c7c8c8b2","resolution":{"observed_at":"2026-08-06T19:38:19.342129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16922","last_updated":"2023-11-28T16:26:35Z","snapshot_observed_at":"2026-08-07T09:15:01.742397Z","submitted_at":"2023-11-28T16:26:35Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16922","snapshot_observed_at":"2026-08-06T19:38:19.346285Z","title":"Mitigating object hallucinations in large vision- language models through visual contrastive decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.346285Z"},"links":{"cited_paper":"/paper/2311.16922","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:40d7a771b212cc6f0ef3b706ae1f18a6cf43fa0828a1d76d548249ef01a29ef7","observation_id":"bba5652d-6683-4270-b8d7-0c0cee8a4b2a","resolution":{"observed_at":"2026-08-06T19:38:19.346285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.188788Z","title":"Multi-modal hal- lucination control by visual information grounding","venue":null,"work_id":"d5cad74b-4609-48c3-a172-e9be9d2d511e","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.350419Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:4261213522cbcf3bca61adb20b0ddb8c8d263271ee51d06b5104fba1eb929a83","observation_id":"de86c1ac-25fa-4518-8f01-552187d3beb7","resolution":{"observed_at":"2026-08-06T19:38:26.342045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.923517Z","title":"Shapley val- ues for feature selection: The good, the bad, and the axioms","venue":null,"work_id":"4faff866-8e16-4b8b-b7e0-fdc3d760bdb7","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.355250Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a215ad4aea0cfec8b86b1104d1fd634ec2265d565812c8c4808770b512e962ba","observation_id":"d0b5b00c-a6cc-499a-95e4-7b5538186ba4","resolution":{"observed_at":"2026-08-06T19:38:26.007838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T19:38:19.359965Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.359965Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:12988887bec6dc6f1ee4c8ca44397d7cf69a6629e30d921c320b4198c0574a7f","observation_id":"922a97d6-8cd5-40e9-a4f3-86892197d85c","resolution":{"observed_at":"2026-08-06T19:38:19.359965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.664800Z","title":"An axiomatic approach to the concept of interaction among players in cooperative games","venue":null,"work_id":"a009ee10-aba5-470b-bf74-e81fcec4873b","year":1999},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.364795Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:c7a7b0ba4ace86ae813a2e36fcd24d646114eee337478c0d279722ef917a5e13","observation_id":"77f4446a-42ab-4603-9988-178a70cc16fe","resolution":{"observed_at":"2026-08-06T19:38:25.786723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-06T19:38:19.369136Z","title":"Sequence transduction with recurrent neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.369136Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:6c0b61a605afc4d9ba6aa88f12ebfbff5ca8944e0f943473c7526610795311fc","observation_id":"ec0d1c72-e24f-42c8-bdae-6eaf36412b51","resolution":{"observed_at":"2026-08-06T19:38:19.369136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.328711Z","title":"A simplified bar- gaining model for the n-person cooperative game","venue":null,"work_id":"f3584577-45c9-4098-a3b7-1864c930f659","year":1982},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.373583Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d5d4c940714bb7c624c76c5ef1392bd9572461eaa5692fc97d5008177cd9ba9b","observation_id":"187b7394-8d7e-4911-a615-871cd4906a1c","resolution":{"observed_at":"2026-08-06T19:38:25.472728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.012867Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"28ebede6-e950-413b-9894-66e9ba7f28b3","year":2019},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.377534Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:047fb7b8388edc264ac2236515e41c80432596427264cbb300db3af4496f0937","observation_id":"fb62258b-cb84-4f16-b3d2-7e649616f458","resolution":{"observed_at":"2026-08-06T19:38:25.162147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.773301Z","title":"spacy 2: Natural language understanding with bloom embeddings, convolutional neural networks and incremental parsing","venue":null,"work_id":"b4a52ff3-ed9e-4ac6-9dc5-dc82c482ceaf","year":2017},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.381831Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:7fd30c5b04b3dd7eeaf0a44e533c22352a108bf71772ac66d235a45e824071ff","observation_id":"3be5026c-c421-4e8c-b802-c24f8f2571ad","resolution":{"observed_at":"2026-08-06T19:38:24.881163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.603814Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"1fbe21a8-5263-4869-b0e9-18a51df757b0","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.385888Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:9e2aa4e1d5070009471f17590bfbc726e703a32d0d3b57dde036c32d361f2664","observation_id":"d2482827-9a6d-4da5-bc0c-2d06dcbf784d","resolution":{"observed_at":"2026-08-06T19:38:24.669459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.423085Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"81ee3f4c-1e17-481a-bb64-7954a36f5d89","year":2019},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.389940Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a520d7c35e2d0702d5b63d2aaba90fa41970a56d9e4b6b8c094fa357bbfcbf6e","observation_id":"c0a21d6c-fcd0-4947-9f66-03d72cb4917a","resolution":{"observed_at":"2026-08-06T19:38:24.493981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-06T05:55:18.425562Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-06T19:38:19.394394Z","title":"Self-introspective de- coding: Alleviating hallucinations for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.394394Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:e2b49bb5a41dfdd7c4026c60225ac351cdd7208ccb0702f40ab64d50be5f69b2","observation_id":"85fe5ffc-b528-4464-a4d3-eac8446b038e","resolution":{"observed_at":"2026-08-06T19:38:19.394394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T19:38:19.398916Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.398916Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:2fba4b1e6cc22de12046a258554dff6b2587a0b175af7a739de85da2dabf68a5","observation_id":"7d197cd5-7f59-4a43-988a-e9eb4e90aee4","resolution":{"observed_at":"2026-08-06T19:38:19.398916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.163392Z","title":"Vcoder: Ver- satile vision encoders for multimodal large language models","venue":null,"work_id":"87a6980a-3baf-470b-9b4a-c9e644972654","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.402801Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5da5e669b5788cb4328f9075729957832854849fea5bb48ce812af6417dbaefa","observation_id":"ae821b85-f618-48d4-84dd-01223ad74e82","resolution":{"observed_at":"2026-08-06T19:38:24.300730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.940362Z","title":"Hallucination augmented contrastive learn- ing for multimodal large language model","venue":null,"work_id":"bfffbc4a-50d5-49b1-baf1-15b2daa5fc91","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.406874Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f56cd381cdc782b9a192aea60fc1749cab23dc4f06e236807ab163710a304aa0","observation_id":"9e1fb101-0060-4cb0-a6ea-95f24be9a26a","resolution":{"observed_at":"2026-08-06T19:38:24.043409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-06T19:38:19.410901Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.410901Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5d2b57e9ce4b06c1a7e1d1987cf179eff2b1a45ad1900d1f99c379ae41560398","observation_id":"650fe551-ea2f-416f-8532-9aa34c0f1079","resolution":{"observed_at":"2026-08-06T19:38:19.410901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15097","last_updated":"2023-07-10T06:08:55Z","snapshot_observed_at":"2026-07-06T14:10:59.567758Z","submitted_at":"2022-10-27T00:58:21Z","title":"Contrastive Decoding: Open-ended Text Generation as Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15097","snapshot_observed_at":"2026-08-06T19:38:19.415802Z","title":"Contrastive decoding: Open-ended text gen- eration as optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.415802Z"},"links":{"cited_paper":"/paper/2210.15097","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8d2ce2ebfb6cd0938d5272c3ea80f85152d426c5bab51f65880185e0a6de8346","observation_id":"8b304bf2-f282-4b24-8413-fbb69e49c2f0","resolution":{"observed_at":"2026-08-06T19:38:19.415802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T19:38:19.425125Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.425125Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f0112c5ac6fb21e288fff9f9ecd145af1a66eb58fbeb51b8b3ad49c8e9c878e7","observation_id":"3fff2933-8b88-45dc-8687-bb999c88e654","resolution":{"observed_at":"2026-08-06T19:38:19.425125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.705982Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"cfeed009-b410-45ad-a652-de43dc87bf63","year":2014},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.429406Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:213a10ffacfeec0b9b198a4013be4b45f0d9c98bc6faa6cb42a1f86af1cff794","observation_id":"73105847-2c71-450b-9247-d91b87a189c8","resolution":{"observed_at":"2026-08-06T19:38:23.825026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T19:38:19.434030Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.434030Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:9ef835f8827f187b9118b273e6b6083057f76b25c2b41e623ce13ab4be994dc2","observation_id":"4e80fea9-ad4e-464c-9660-ffea4130c2d0","resolution":{"observed_at":"2026-08-06T19:38:19.434030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.527406Z","title":"Llava-bench in the wild dataset","venue":null,"work_id":"084e30e0-37e9-40e9-bb5e-1c297068b324","year":2025},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.439024Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a7afd52b50c0f4096321f6e28ce1b5326c81055a8723e34e2bedbd4d75ba2392","observation_id":"aeaffdb4-21ca-48e3-aef6-f3b0309677d1","resolution":{"observed_at":"2026-08-06T19:38:23.638230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.255569Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"5961b1ea-827e-4e60-9bf9-56fa531a372e","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.443488Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f7b1476dbc7d084ab015fcbafa5442647a4e96e7d3ed2839f63ae2215b4795e8","observation_id":"b0b1efb2-7dcc-450b-a7b4-f8a51466909d","resolution":{"observed_at":"2026-08-06T19:38:23.365231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T19:38:19.448410Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.448410Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:edd65da4164e28b832b8ebca87466fac666ed2519cd9183fbeec57a7e5ca2433","observation_id":"81672b28-54e1-412e-8f76-d4d9f27341a0","resolution":{"observed_at":"2026-08-06T19:38:19.448410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13906","last_updated":"2024-08-25T18:02:36Z","snapshot_observed_at":"2026-07-06T19:05:44.820697Z","submitted_at":"2024-08-25T18:02:36Z","title":"ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13906","snapshot_observed_at":"2026-08-06T19:38:19.453361Z","title":"Convis: Contrastive decoding with hallucination visualiza- tion for mitigating hallucinations in multimodal large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.453361Z"},"links":{"cited_paper":"/paper/2408.13906","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:011055dd4e813458c7e3214843a12a39b97bf99c539e7240669d6a9ad3bd56e7","observation_id":"6d962263-043a-4890-9fac-f8d2c0a7c1b6","resolution":{"observed_at":"2026-08-06T19:38:19.453361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02904","last_updated":"2024-04-03T17:59:36Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:36Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","version":1},"cited_work":{"arxiv_id":"2404.02904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02904","snapshot_observed_at":"2026-08-06T19:38:19.950880Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","venue":"cs.CV","work_id":"bd073d1b-b57c-458d-bdd0-cb26c2086348","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.457909Z"},"links":{"cited_paper":"/paper/2404.02904","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:bb309ae74dd521324cdac9565e6877799583bc79792a7b5ee125c210999da72c","observation_id":"9e4ebc1a-37c7-4fcb-8372-16f4320294f6","resolution":{"observed_at":"2026-08-06T19:38:19.955781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17150","last_updated":"2024-08-30T09:40:10Z","snapshot_observed_at":"2026-08-07T02:34:01.294703Z","submitted_at":"2024-08-30T09:40:10Z","title":"Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17150","snapshot_observed_at":"2026-08-06T19:38:19.462703Z","title":"Look, compare, decide: Alleviating hallucination in large vision- language models via multi-view multi-path reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.462703Z"},"links":{"cited_paper":"/paper/2408.17150","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:3aa8efe63640784bea82445fc4fc42f918a562fd463f1889e1901ca739cfb4fd","observation_id":"ec5bf09a-d69e-431f-aa31-6fb443969130","resolution":{"observed_at":"2026-08-06T19:38:19.462703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03536","last_updated":"2021-11-08T05:26:14Z","snapshot_observed_at":"2026-07-06T12:05:52.781976Z","submitted_at":"2021-11-05T14:57:49Z","title":"A Unified Game-Theoretic Interpretation of Adversarial Robustness","version":2},"cited_work":{"arxiv_id":"2111.03536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.03536","snapshot_observed_at":"2026-08-06T19:38:19.912617Z","title":"A Unified Game-Theoretic Interpretation of Adversarial Robustness","venue":"cs.LG","work_id":"662ac2bf-4ef8-4163-97c6-a746fb3b5688","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.467577Z"},"links":{"cited_paper":"/paper/2111.03536","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:4adb139373615f054e4235ca143e5a3e6a6f43bb7be3a1abcc8c70e512a4aef6","observation_id":"29eeb48a-e5e8-4c2c-a46b-9dfcece3af37","resolution":{"observed_at":"2026-08-06T19:38:19.917414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10719","last_updated":"2023-05-24T11:36:09Z","snapshot_observed_at":"2026-07-06T11:11:51.862564Z","submitted_at":"2021-05-22T13:03:18Z","title":"Can We Faithfully Represent Masked States to Compute Shapley Values on a DNN?","version":4},"cited_work":{"arxiv_id":"2105.10719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.10719","snapshot_observed_at":"2026-08-06T19:38:19.890676Z","title":"Can We Faithfully Represent Masked States to Compute Shapley Values on a DNN?","venue":"cs.LG","work_id":"98a0183e-0442-4d8a-9c2b-edc370754b85","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.472048Z"},"links":{"cited_paper":"/paper/2105.10719","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:e6f93c81e22280ecd7abc2476e9cc27a79a66e6346e65e8c133a1f95687a41fb","observation_id":"f7b76607-d9c0-49f4-a0e9-d0350ac9c7c2","resolution":{"observed_at":"2026-08-06T19:38:19.895832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.051386Z","title":"Defining and quantifying the emergence of sparse concepts in dnns","venue":null,"work_id":"d46f0969-8076-4f0d-a737-07293c8f194b","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.476497Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:180358bd5c5503e59e5475ecd3798af7a437f0ef74cad18a6a30551084f861f4","observation_id":"f529a361-e618-4838-bf63-674bd14f7232","resolution":{"observed_at":"2026-08-06T19:38:23.153811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.480573Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.480573Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f097124c481dc2977e16cd720d15c1077774c0448f5cac662efbc6082e6c5adc","observation_id":"c7583dc6-9f33-4fa0-b27a-04ca6a6e529a","resolution":{"observed_at":"2026-08-06T19:38:19.480573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.489518Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"46af2b38-7d55-4428-bcbc-cea09c26585b","year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.490255Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:e9c2d8575176443564dc599d35e105f5ba52b24d9f2e94a0cfcdc6b76e9b2ec2","observation_id":"bf777500-2db8-4457-8708-d6c7a1881bef","resolution":{"observed_at":"2026-08-06T19:38:22.623496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.249902Z","title":"A value for n-person games","venue":null,"work_id":"68991584-b9be-4950-a6f2-26aa258e7918","year":1953},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.494518Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8750076ce2e86ca2c05fef8300a71a1bf3be662cb5b26b4e60c94d94d5c3a723","observation_id":"134f230f-6abd-48f1-bc93-ccac0a28ee95","resolution":{"observed_at":"2026-08-06T19:38:22.352688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10457","last_updated":"2024-07-15T06:12:17Z","snapshot_observed_at":"2026-07-06T18:46:18.540571Z","submitted_at":"2024-07-15T06:12:17Z","title":"The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10457","snapshot_observed_at":"2026-08-06T19:38:19.498886Z","title":"The good, the bad, and the greedy: Evaluation of llms should not ignore non-determinism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.498886Z"},"links":{"cited_paper":"/paper/2407.10457","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:bf05cb83afd4849431fb6bd48ce07bae3830937950e53d9191e008688b90d8e6","observation_id":"4b4ff39a-1a9f-4ecc-9496-2c30b67cc78b","resolution":{"observed_at":"2026-08-06T19:38:19.498886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T19:38:19.503233Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.503233Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:3f719532f1bb13c3246e9c393d5801f5ae4dff8a983bc2c3cecd8d8d036a156c","observation_id":"cc52176b-9033-4924-9e8f-ff9bf702d255","resolution":{"observed_at":"2026-08-06T19:38:19.503233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.021680Z","title":"The many shapley values for model explanation","venue":null,"work_id":"0f39d179-142e-43a3-8b04-cda8bb806d56","year":2020},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.507571Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:63572a778072587d3a740b1324ae47ed88ac1237c98799d75b143d7e84d2aed9","observation_id":"b3985708-eed1-4484-be13-cc06e5b71596","resolution":{"observed_at":"2026-08-06T19:38:22.121952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.821353Z","title":"The shapley taylor interaction index","venue":null,"work_id":"f21acb3d-0bc3-422a-806b-63dca42dc55d","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.511674Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:671c68c3b9a219d41d0f53c7f9f0640298546056050aea5699f62f49ae91789b","observation_id":"483ef97e-44a0-4c56-a920-789bcbdf22de","resolution":{"observed_at":"2026-08-06T19:38:21.928008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.561242Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":"e5c3171e-0ac2-42c9-8e06-b5511c576aec","year":2014},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.515913Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f9a826357feb852513c6a105bb5a9d31be1c0ce62720044afadedb7610a49447","observation_id":"f7bbec4e-1e31-4cd5-bee2-e9a28e5dae72","resolution":{"observed_at":"2026-08-06T19:38:21.648284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:38:19.520881Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.520881Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d3370275ef0dca3ed745cbc219bd50914ea00228e09dd134dcbc224406b2e844","observation_id":"ef6b4625-eaa3-4d29-93ec-b0a1065b24c1","resolution":{"observed_at":"2026-08-06T19:38:19.520881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-06T19:38:19.525397Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.525397Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:458e05407e375b08e34f12761908059fa1f9b244348a69b11be1eee9d0070a92","observation_id":"c19d4d64-6667-4f9a-991a-0ced4f2edaf2","resolution":{"observed_at":"2026-08-06T19:38:19.525397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17201","last_updated":"2024-05-27T14:22:03Z","snapshot_observed_at":"2026-07-06T18:20:35.626876Z","submitted_at":"2024-05-27T14:22:03Z","title":"Diagnosing the Compositional Knowledge of Vision Language Models from a Game-Theoretic View","version":1},"cited_work":{"arxiv_id":"2405.17201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17201","snapshot_observed_at":"2026-08-06T19:38:19.804227Z","title":"Diagnosing the Compositional Knowledge of Vision Language Models from a Game-Theoretic View","venue":"cs.CV","work_id":"cca05e10-0e54-41a8-bdfe-64ce14348264","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.529779Z"},"links":{"cited_paper":"/paper/2405.17201","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a245f711fb74629efb8997d19ad1a6770ad5d977eba3d3c7ba23f30837b5be62","observation_id":"4a4c0d5b-4252-49cc-9412-e49e25669e1c","resolution":{"observed_at":"2026-08-06T19:38:19.809275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.350797Z","title":"A unified approach to interpret- ing and boosting adversarial transferability","venue":null,"work_id":"c176b844-a5a6-4300-8199-ab7b6eb589a5","year":2020},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.534455Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:cdbb712c46159f07ca1cc32f2434de3d100aca4e863795b6df58db083da2436c","observation_id":"318c25dc-19f0-48ea-b975-02a146fb879c","resolution":{"observed_at":"2026-08-06T19:38:21.453645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.027041Z","title":"Interpreting attributions and interactions of adversar- ial attacks","venue":null,"work_id":"4a5bb505-d1c7-44cf-9a0c-3b2c88c666b8","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.538795Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:6b96778c8c22e45fed54a826ec1309c4c1806a6486e15e90fff4d1b8cce62be6","observation_id":"ca4a43e2-58b5-4920-8419-6ad8d5c82730","resolution":{"observed_at":"2026-08-06T19:38:21.177952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17821","last_updated":"2024-12-16T10:27:35Z","snapshot_observed_at":"2026-07-06T18:21:05.410042Z","submitted_at":"2024-05-28T04:41:02Z","title":"RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17821","snapshot_observed_at":"2026-08-06T19:38:19.543126Z","title":"Ritual: Random image transformations as a universal anti-hallucination lever in lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.543126Z"},"links":{"cited_paper":"/paper/2405.17821","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:18b008ccfa26a8e3adbb7231a1dc999ff9838c079a35faa508b38c703990c494","observation_id":"77c0045a-de0e-4004-8161-4ae7263fe224","resolution":{"observed_at":"2026-08-06T19:38:19.543126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T19:38:19.547606Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.547606Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0024f79ac4e6242785609802ea77f433c04d929c997dd402df79a3772e47f175","observation_id":"291c248f-be04-408f-ad8b-2f4e79a1109e","resolution":{"observed_at":"2026-08-06T19:38:19.547606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.821181Z","title":"Towards understanding the generalization of deepfake detectors from a game-theoretical view","venue":null,"work_id":"1f6fee67-b918-4b75-9f15-155baa118769","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.552093Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8589c266437c0061c3382a6a6651d97c5efc6afc2934100aafb0b8cba2105709","observation_id":"2012884b-c9c0-4439-b567-4e795a5af1ff","resolution":{"observed_at":"2026-08-06T19:38:20.921201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T19:38:19.557416Z","title":"mplug-owl: Modularization empowers large language models with mul- timodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.557416Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:bf5179bb2fecfc4d8b9685bebb072e9b5271d1f19e10fb775e257d19ea9223c4","observation_id":"d2164764-afa4-44f7-93a9-57ab4100f894","resolution":{"observed_at":"2026-08-06T19:38:19.557416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.754932Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"82204730-7c8f-4911-a707-73b71e95f927","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.562593Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:03cdc1f560a83bec43263717e633ed3fcdc1588aa4a249888e2431f2bfc81870","observation_id":"1249e4de-e633-47bc-a3ec-c0384cf3736e","resolution":{"observed_at":"2026-08-06T19:38:20.772787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.704041Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"65eafd14-e775-4f63-b545-9ffc043a6832","year":2016},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.566697Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a45a10fa900bdf8f98793462c6620de3e7d6d1162e7fce8dc6a2c3a3d5fc2ecc","observation_id":"050f154d-3fe5-4eaf-b8f7-2c0f1e30488e","resolution":{"observed_at":"2026-08-06T19:38:20.724467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.683654Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data","venue":null,"work_id":"931d1b99-a37a-4ece-ab3b-e7b353eadb67","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.570923Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:04630e8a871ced4c64bd8b5103f54fd85c985f3c2dcbb10ee1c195bb333a0b68","observation_id":"0161e570-e149-4c75-8a73-c60890974455","resolution":{"observed_at":"2026-08-06T19:38:20.689823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-07-06T17:33:58.900451Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-06T19:38:19.574901Z","title":"Less is more: Mitigat- ing multimodal hallucination from an eos decision perspec- tive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.574901Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:37f482a9bb2e4f50b98eeb5d5b1ffba9b68b34dcea561ac74b368e28a754e0b2","observation_id":"96b9cab1-d2a4-41a3-aa61-3ccb702988e5","resolution":{"observed_at":"2026-08-06T19:38:19.574901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.662461Z","title":"Halle-switch: Controlling ob- ject hallucination in large vision language models","venue":null,"work_id":"305d0d30-6971-47eb-a1ae-051860662982","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.579844Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:9ee9fb1df1f66be1e9b28669f404f85678b663fa6f42d3fe440b37fcd721ac58","observation_id":"945083b6-f25e-4346-8cda-b30ad4879084","resolution":{"observed_at":"2026-08-06T19:38:20.669545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.647798Z","title":"Building interpretable interaction trees for deep nlp models","venue":null,"work_id":"6ee8d66e-88c5-45fa-93e9-ad1a5f5af33f","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.584614Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:cd62b58ca8b0634ea083c5248487c2db6fc430d80d0113bacb1b8732db014ffd","observation_id":"f0ae7641-632e-49fc-a02b-7846e89581c5","resolution":{"observed_at":"2026-08-06T19:38:20.653107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14978","last_updated":"2021-02-03T09:52:35Z","snapshot_observed_at":"2026-07-06T10:09:27.733347Z","submitted_at":"2020-10-28T13:40:57Z","title":"Technical Note: Game-Theoretic Interactions of Different Orders","version":2},"cited_work":{"arxiv_id":"2010.14978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.14978","snapshot_observed_at":"2026-08-06T19:38:19.717738Z","title":"Technical Note: Game-Theoretic Interactions of Different Orders","venue":"cs.LG","work_id":"9fb1da7d-c6ee-4b2e-abf6-75ba491fc21c","year":2020},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.588776Z"},"links":{"cited_paper":"/paper/2010.14978","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0793edc98de0a94193ee4dfbddc989f3ef009b9491a87b1006efe467a1649279","observation_id":"97bc30db-ad68-4f09-9ef3-52995a9da03f","resolution":{"observed_at":"2026-08-06T19:38:19.724425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.632454Z","title":"Interpreting multivariate shapley interac- tions in dnns","venue":null,"work_id":"2f7b2cd1-6c98-4c67-9889-d0cd7f254409","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.593003Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:20818f2a9508caca60024cbe48f84c2078d3e5c8ae9899d09e4b39ce69689dfc","observation_id":"ea42423c-a0f1-4822-a4c0-89f4b104e7b0","resolution":{"observed_at":"2026-08-06T19:38:20.637752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.617205Z","title":"Explaining gen- eralization power of a dnn using interactive concepts","venue":null,"work_id":"b43672f1-9f5f-431f-8a02-aefc26e54d27","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.597266Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:1c76bb4017072e92c80316002fd07cf8dbd280db448341047d8cea66b5d7cb4c","observation_id":"624be49e-5c6c-4b77-91a8-fce28c0273bd","resolution":{"observed_at":"2026-08-06T19:38:20.622141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03577","last_updated":"2025-05-08T05:49:30Z","snapshot_observed_at":"2026-08-06T09:14:02.055269Z","submitted_at":"2024-10-04T16:30:54Z","title":"Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03577","snapshot_observed_at":"2026-08-06T19:38:19.601377Z","title":"Look twice before you answer: Memory-space visual retracing for hallucination mitigation in multimodal large language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.601377Z"},"links":{"cited_paper":"/paper/2410.03577","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:4d2824d3cd22e229e5d7da4de7b0f00afaa576735f03984ed93c4624e48f5c44","observation_id":"6e02966d-90f4-4502-aaf9-660001192938","resolution":{"observed_at":"2026-08-06T19:38:19.601377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.602219Z","title":"The Polling-based Object Probing Evaluation (POPE) [33] utilizes images sampled from several datasets, including MSCOCO [35], A-OKVQA [47], and GQA [26]","venue":null,"work_id":"b511a979-dc2a-487a-a041-8e974200e8e5","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.605809Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:9d43e2bd1cd0583e95bd7609c65dc154d403fb456161371234e2410890cd1da8","observation_id":"6f633e1e-5a50-4c4b-bc46-ee9819a304bc","resolution":{"observed_at":"2026-08-06T19:38:20.607116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.588549Z","title":"As shown in Tab","venue":null,"work_id":"8d2dae3b-4dc0-4819-8b20-3c806f655131","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.610211Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:51760f9b2ca8e3715ef303f6b948e65dda20895cf94ca80e3ba37fa34cb44a49","observation_id":"c0db2e3d-7c47-4cc1-a523-b4e07dd744a7","resolution":{"observed_at":"2026-08-06T19:38:20.592658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.575015Z","title":null,"venue":null,"work_id":"f2691d49-0b19-4e67-b187-873976b4c275","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.614489Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:1dcb55fd7c8c34f87e0e8f5a361326139c866c5a1144881faeeea907b5721d34","observation_id":"a5f312c9-410c-4083-aed1-bceda856df19","resolution":{"observed_at":"2026-08-06T19:38:20.579002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.560774Z","title":"Through experiments on CHAIR [46] and MME [19] benchmarks, we analyze how the interaction guidance co- efficient k affects the performance of INTER","venue":null,"work_id":"753c8006-3145-4514-8b4f-516298e75328","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.618717Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d8e5a1360754ea58bcfe224f1e2f5491920ff326566ca23d1a667017eccaf99e","observation_id":"2428d4a3-430c-417d-9f43-2122bc72bdff","resolution":{"observed_at":"2026-08-06T19:38:20.565237Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.545464Z","title":"The results, as shown in the Tab","venue":null,"work_id":"fdfad88b-ab28-4daf-b9b9-7a72d89fe542","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.623097Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:c425ccce637d5774c5ccfda041feff075095ce72dabfa269abb31617bfad9b3a","observation_id":"b98024fe-4daa-4488-939a-18b2d5b3dd89","resolution":{"observed_at":"2026-08-06T19:38:20.549878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.530647Z","title":"As shown in Tab","venue":null,"work_id":"24695990-0f9f-45bc-9102-4286de95af75","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.627527Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:1a73ba638238b353a9a9d2c029d0a9d19b63d7e50bbdc670acde6734db6f2a8f","observation_id":"ddc901fa-c9c4-4dd7-ba52-e189e078691b","resolution":{"observed_at":"2026-08-06T19:38:20.534946Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.515069Z","title":"10, 19 and 20","venue":null,"work_id":"d58afe82-dc82-4c70-b47d-260689943475","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.632418Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:603c2483dc2f66531327f3a7bf63badcecff606fbe11eef471b7636210221040","observation_id":"defe6cd6-866c-4951-8aa3-a9cd43e97b6e","resolution":{"observed_at":"2026-08-06T19:38:20.519750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.499828Z","title":"12, 23 and 24","venue":null,"work_id":"5c01470c-4313-43a6-b8d1-193e53891617","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.636734Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:014e0d12a6c962fdcb55081850d7152dab5f4d85dfc8fa72cc42aeefda4cfbfa","observation_id":"af3be004-b5ae-4e4c-a261-b1d82dcf65b4","resolution":{"observed_at":"2026-08-06T19:38:20.504515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.483469Z","title":"8 to 13, 15, 16 and 19 to 26, we demonstrated the effectiveness of INTER in correcting the Greedy Search across various benchmarks","venue":null,"work_id":"644eb96f-baf7-45ef-aec9-c00324570a1a","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.640857Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:2fa6c45d1bf29cb726b61c1008a235e05a7d5ff771dd1aed332e56df00629185","observation_id":"8de149a9-a5a9-414d-a7db-9902c042dea8","resolution":{"observed_at":"2026-08-06T19:38:20.488666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.467433Z","title":null,"venue":null,"work_id":"40627827-2cd5-4ebb-92ee-39cb6e72d8a0","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.644875Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:2412c18c6b8e4387e48781954751f595685dedc7c11ee8ed6b0839f5a90a49ce","observation_id":"89c1f77e-73c8-4eb8-bcf2-9fbf0235e02b","resolution":{"observed_at":"2026-08-06T19:38:20.472206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.452375Z","title":null,"venue":null,"work_id":"5336746e-c7d8-4a97-b1e2-0ca659463b87","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.648885Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d4557a1172858f25a96ce26031f3839cba3f76f2b945824eb8e0a46469c4d283","observation_id":"37e6d830-d325-497c-b8e6-b96d45aab416","resolution":{"observed_at":"2026-08-06T19:38:20.456978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.437645Z","title":"We conducted experiments with M3ID [17], Ritual [59] and SID [27] in Tab","venue":null,"work_id":"7bf33d07-40ef-4514-897d-5c276ad0408c","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.652910Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:3459fbad383225c0e699b79ce4ff5b55a9fc467cbfed14f1cc4552702e369deb","observation_id":"4b41057f-1334-46b1-aaad-5288789c308d","resolution":{"observed_at":"2026-08-06T19:38:20.441900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.422649Z","title":"We conducted experiments with DeepSeek-VL2 [60] on the visual grounding task","venue":null,"work_id":"cdb5dc56-69db-4fd9-963f-216e69cad8dd","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.656842Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:c8806cce54e3e264eb945b2a43c82bce156612ae04b39ce45ff38b787c8051b1","observation_id":"92dbc7f1-a87a-49c6-844f-70792efc36be","resolution":{"observed_at":"2026-08-06T19:38:20.427414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.406660Z","title":"The value range of I(A)yt could be influenced by several factors, e.g., benchmarks, LVLMs, etc","venue":null,"work_id":"9bca9dd3-6518-40af-bd1c-49a38f301cdd","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.660978Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:cddefa643b7e918e1392f2ae5c54b4559d88b2aae35ad3297b685553ccbde1ef","observation_id":"f7ea1276-1890-405f-8bde-6650a8abbb3f","resolution":{"observed_at":"2026-08-06T19:38:20.412188Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.744052Z","title":null,"venue":null,"work_id":"3996e562-cd6e-4e47-9384-3b58e5a6a94f","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.485115Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:42ec51a849986764f266cfb9519069ea3137be7ad9bc8656abd7d638d5457e47","observation_id":"9d487f5e-a3a1-4ef4-b53f-64c24dd8b809","resolution":{"observed_at":"2026-08-06T19:38:22.871959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.332718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.332718Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:386773ca25cadeef07b3b5f1dd36f83b0662a33b8791d26c8ba5ff8181897ff9","observation_id":"7d3728dc-8d71-4c22-b751-2ea4a757c123","resolution":{"observed_at":"2026-08-06T19:38:19.332718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.300877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.300877Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8da0c3b2f61bc94dc2d7c8d118b43ec7e82e711621e63ba57e302a20a2b2aab3","observation_id":"4feeb5fa-42da-4d45-8334-fdff83141b03","resolution":{"observed_at":"2026-08-06T19:38:19.300877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":5,"verified_fuzzy":37},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2507.05056."}