{"as_of":"2026-08-14T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:907f6202a00bded96016fb14f40b83faf5ff2b1a8155ca78174a0c7d15ffa335","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:25:43.222317Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:32:34.535229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T08:56:06.356150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-08-06T15:32:34.535229Z","title":"Delve into visual contrastive decoding for hallucination mitigation of large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-11T23:02:25.619692Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.535229Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:2b23e81e40acc3167faaf406126c2d79e03b4fd0ed2ed22221a90a053cbfbfeb","observation_id":"18cf72b5-94b0-4ae0-a7ec-10d30ecc1f81","resolution":{"observed_at":"2026-08-06T15:32:34.535229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-08-05T20:29:00.151968Z","title":"Lee et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-13T23:10:52.614750Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:00.151968Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:b8d0b39000ffa0628f32b4308017538ebb44bf7873275c985dfe9ed74dd8daa6","observation_id":"6358ed77-3327-433b-ba74-e9eb8a1b005f","resolution":{"observed_at":"2026-08-05T20:29:00.151968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.06775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-07-09T08:56:06.356150Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","venue":"cs.CV","work_id":"b7909265-35b9-4013-a6f6-8ff677680b56","year":2024},"citing_paper":{"arxiv_id":"2604.12115","last_updated":"2026-04-13T22:47:27Z","snapshot_observed_at":"2026-08-11T12:49:44.661490Z","submitted_at":"2026-04-13T22:47:27Z","title":"HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:13:49.239474Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2604.12115"},"observation_digest":"sha256:2ed1128385a0a805cec1940f7e09f5feaa53bfb8187a36c058278a2d995e2e96","observation_id":"7cdabcfd-179b-411b-bf3b-dfea25b79a05","resolution":{"observed_at":"2026-05-11T11:01:04.114352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.06775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-07-09T08:56:06.356150Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","venue":"cs.CV","work_id":"b7909265-35b9-4013-a6f6-8ff677680b56","year":2024},"citing_paper":{"arxiv_id":"2606.09859","last_updated":"2026-05-31T13:02:00Z","snapshot_observed_at":"2026-08-13T15:14:38.925995Z","submitted_at":"2026-05-31T13:02:00Z","title":"Mitigating Manifold Departure: Uncertainty-Aware Subspace Rectification for Trustworthy MLLM Decoding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T17:51:38.268304Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2606.09859"},"observation_digest":"sha256:86db2dc41b93c60a9c1d3aac6815d3c401ff80aaa257e3756c2a6e839e4dd1fb","observation_id":"de348113-2b4f-45c1-825a-7590cb12c68e","resolution":{"observed_at":"2026-06-28T17:52:27.176357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.06775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-07-09T08:56:06.356150Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","venue":"cs.CV","work_id":"b7909265-35b9-4013-a6f6-8ff677680b56","year":2024},"citing_paper":{"arxiv_id":"2607.07507","last_updated":"2026-07-08T15:02:11Z","snapshot_observed_at":"2026-08-02T18:08:34.221940Z","submitted_at":"2026-07-08T15:02:11Z","title":"HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T08:53:11.691585Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2607.07507"},"observation_digest":"sha256:afb6286207392881ee05e386488f9ed7251767951e001be71d3cfb3f9024f93e","observation_id":"54a217d7-584a-4a4a-b167-7ba3f158eb35","resolution":{"observed_at":"2026-07-09T08:56:06.357908Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-07-31T02:56:57.075696Z","title":"Delve into visual contrastive decoding for hallucination mitigation of large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-10T13:40:32.070762Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.075696Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:17ae78349152d149e4a15fb2fea1da5a422c8879e8472a77e99ee258e5976df4","observation_id":"b6858d32-aa28-412d-bd2e-cee69eb4cc7c","resolution":{"observed_at":"2026-07-31T02:56:57.075696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06775/citation-record","integrity":"/paper/2412.06775/integrity","json":"/paper/2412.06775/citation-record.json","paper":"/paper/2412.06775"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T19:25:43.085801Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.085801Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:d02a4dc0ad2347ff818ca8f3501569bfa94180e58512708c44b9f3238f28edfa","observation_id":"f81003c4-eb9b-44d3-b95a-426db803149b","resolution":{"observed_at":"2026-08-11T19:25:43.085801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T19:25:43.089992Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.089992Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:01c4c4bad919f4654762a6008a2d0786321dbd784cbbb4ae9ad9ffe4161d5b0b","observation_id":"00c7294d-3460-49be-89af-3ab1ed637e56","resolution":{"observed_at":"2026-08-11T19:25:43.089992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.743047Z","title":null,"venue":null,"work_id":"678d67f8-5054-4dca-a678-2665b402c8a4","year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.093137Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:721135cfc0e6fce79186ebec2583181c35058bc168b8165d2c96d0d70de7cfa3","observation_id":"62df30b9-d049-4346-8ab8-62cd7c8470b6","resolution":{"observed_at":"2026-08-11T19:25:43.746315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-13T04:05:43.225856Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-11T19:25:43.096461Z","title":"Halc: Object hallucination re- duction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.096461Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:59e4de17e23829a9121445a2a01586d2eb8f4d92bd55beec8b0ba4063e8a543e","observation_id":"517f5c42-b516-4ecf-baba-4e6026fc226b","resolution":{"observed_at":"2026-08-11T19:25:43.096461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.732742Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"392cb40d-147f-4a14-8cd4-a6547c1bed2e","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.100115Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:45dcfdc17bbae79ffa4b13bb3c9746f2e5e1785b4b9893c1c649841f73225558","observation_id":"93922246-4e44-4c3f-9cc7-03c0ca023dc0","resolution":{"observed_at":"2026-08-11T19:25:43.736416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15300","last_updated":"2024-04-23T09:32:25Z","snapshot_observed_at":"2026-08-13T04:12:09.381501Z","submitted_at":"2024-02-23T12:57:16Z","title":"Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15300","snapshot_observed_at":"2026-08-11T19:25:43.103583Z","title":"Seeing is believing: Mitigating hallucination in large vision- language models via clip-guided decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.103583Z"},"links":{"cited_paper":"/paper/2402.15300","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:0c4707cb6e0943fc0327329bb61772c3c827d5c1c669b1e6dade01739e4b6f64","observation_id":"7b815f0f-d8b1-4f3d-9857-d44491380db0","resolution":{"observed_at":"2026-08-11T19:25:43.103583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.718112Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":"dace8a8c-478d-425a-86d0-6d3a17916c3c","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.107189Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:d789d6f2ed42ae6d82ac1f8ac97ed9ea00020b226b751223683c4fc62978a7b3","observation_id":"f43832ae-4428-4888-ace2-f2fd5a4d313e","resolution":{"observed_at":"2026-08-11T19:25:43.725141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T19:25:43.110475Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.110475Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:9994838d10772df57e063149d0a0002a06978626ea7a8add4e7bcf58ae5ca1b0","observation_id":"b2e9237c-30fb-4fa7-a169-5f29ee22efdf","resolution":{"observed_at":"2026-08-11T19:25:43.110475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.708441Z","title":"Instructdiffusion: A generalist modeling in- terface for vision tasks","venue":null,"work_id":"a2627fe2-6d37-4673-a320-1b16359abc12","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.114204Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:b68a8d8fa379dc4f823ade12ac435d3a32cbf512a2c41eef1d6c3d8ce5045f1f","observation_id":"ea98e691-5f73-42c1-9c38-4b7fb90f7821","resolution":{"observed_at":"2026-08-11T19:25:43.711754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.698071Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"d12823e4-9782-4897-9f12-87005c5a5f96","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.117481Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:af9c889bfbff971bdcc314dd698a9fdfbecb2e305b5857b4323f56aa4ae663b6","observation_id":"bc02ed5b-1846-4ea6-ba46-102392dd5a4b","resolution":{"observed_at":"2026-08-11T19:25:43.701499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.121208Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.121208Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:b6f3d91a0c7f77f4d4770ec403029c1b74c4b362e7bc73406a6b144c854c4595","observation_id":"84948a4d-a461-4a2b-9e92-f4cf2989c798","resolution":{"observed_at":"2026-08-11T19:25:43.121208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.682314Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"ceaa4ad9-8f2c-409a-9fa9-f8bd94714a79","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.124441Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:cd8f6cc176e0c8d91c354842b56df45143e05bffb7fbf02caec8c55d13298cda","observation_id":"b78fe7dd-76a9-4bdb-99aa-f1e784112c1c","resolution":{"observed_at":"2026-08-11T19:25:43.685604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.671962Z","title":"Mitigating object hal- lucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"b96de7d7-9d13-4441-a44f-25adfa4a83a7","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.127665Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:aa9d2e292af33eb402db5d5798695d6e99e524f40474dc9a09fcbd8fe32f0192","observation_id":"cd106b2e-f4d4-436b-b522-9cafdb9f0487","resolution":{"observed_at":"2026-08-11T19:25:43.675200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.663587Z","title":"Contrastive decoding: Open-ended text gener- ation as optimization","venue":null,"work_id":"ec2ca0fd-24ae-4b24-809b-7922916f097f","year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.130923Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:786eba9eec6636c554f7f82df6f24dbaf3e19fcf7323736ed50af9bf8261fb77","observation_id":"fdb1833b-144d-4e50-9a57-5c730edc5928","resolution":{"observed_at":"2026-08-11T19:25:43.666353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.655210Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"41741570-591b-401f-9387-7cececc3739f","year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.133951Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:298f2badb8452ecba4508d9c2bdf2ca93084bfb32f92fdc132c415eda3dde2cb","observation_id":"c0c474f4-2b89-4a96-8bfe-aeb2bc49a9bc","resolution":{"observed_at":"2026-08-11T19:25:43.658205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.646030Z","title":"Text-driven image editing via learnable regions","venue":null,"work_id":"9f50f408-5403-4e12-87d1-f007e2cba684","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.136981Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:eac61ba02c9ace497bf5017d9b605871b7b0ff2dce5cfc11cd460dc16fffcefb","observation_id":"cb1469dc-2884-4420-93cb-3839b04fb2ba","resolution":{"observed_at":"2026-08-11T19:25:43.649208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.636794Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"5bbcf803-5dbc-49f6-b65c-43a462015d90","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.140962Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:76869be29fc50e13a3622167d7c3ec0d2907014b48b1f9ad1dda42883f59f363","observation_id":"b8d68aa0-5963-4ebc-a0d2-61937d6bad36","resolution":{"observed_at":"2026-08-11T19:25:43.639865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.628265Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"2ed5e9c1-b03c-4989-9adf-7d822a188b67","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.144497Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:4e24f1daa9148e882345af59d0f5725369b8446ae50202a339f43570fdbcd2a9","observation_id":"cbcb75aa-e72c-48c8-8e20-05c7ad93dce3","resolution":{"observed_at":"2026-08-11T19:25:43.631319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.619084Z","title":"Clip-dpo: Vision-language models as a source of preference for fixing hallucinations in lvlms","venue":null,"work_id":"a518b5fb-0fd3-4c67-9cd9-e5bc6682f697","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.148074Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:41c96a9c140c5ebd937647653699b1df24584dad4cba14dc74d99f84e8f6044a","observation_id":"86ba8ac8-82d8-4010-8b5f-11610c3101e6","resolution":{"observed_at":"2026-08-11T19:25:43.622293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.611019Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"cc8c815d-0969-4a8f-a9ad-f3edc13fb5d0","year":2021},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.151684Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:50f494b30043fabd17d24300daa01f65aa5336537cfe82261e1f1be9c22cd880","observation_id":"88d01faf-908b-4051-86b9-0b52c6809771","resolution":{"observed_at":"2026-08-11T19:25:43.613840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.600909Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"76f12b5f-0796-484e-b6ca-1328a54a4d6c","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.154771Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:dbeac3718d386c6e4fd2eaeb7f6f8a3a5e83e9fd63b389cdfee5ef235b63f26a","observation_id":"7f6ef8f0-253d-4913-a6e1-9d250a35610f","resolution":{"observed_at":"2026-08-11T19:25:43.603869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-11T19:25:43.157562Z","title":"Aligning large multi- 9 modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.157562Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:3084abdb885d669e0932ae663bcdb2077dba30c0558a30ad96a5c2b9c52ec06e","observation_id":"c0a999d9-f1c2-4de5-a36f-300120b60743","resolution":{"observed_at":"2026-08-11T19:25:43.157562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T19:25:43.160806Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.160806Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:a99c80373f44916fcf5c89e9b9750a8a48cf118ae7740be76785df22be92273e","observation_id":"411676ff-41a7-4ceb-99e0-838a4fcab313","resolution":{"observed_at":"2026-08-11T19:25:43.160806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18715","last_updated":"2024-06-05T13:53:42Z","snapshot_observed_at":"2026-08-13T00:43:41.841314Z","submitted_at":"2024-03-27T16:04:47Z","title":"Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18715","snapshot_observed_at":"2026-08-11T19:25:43.163408Z","title":"Mitigating hallucinations in large vision-language models with instruction contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.163408Z"},"links":{"cited_paper":"/paper/2403.18715","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:ea0caa2376eaa80a96ef48ae9060f601688e6f868008dabbf528916e7bf5c8ab","observation_id":"d4e90c2a-908a-49cd-bfb5-b35d75f245d3","resolution":{"observed_at":"2026-08-11T19:25:43.163408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00238","last_updated":"2024-08-30T20:11:00Z","snapshot_observed_at":"2026-08-14T15:58:13.720068Z","submitted_at":"2024-08-30T20:11:00Z","title":"Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data","version":1},"cited_work":{"arxiv_id":"2409.00238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00238","snapshot_observed_at":"2026-08-11T19:25:43.378963Z","title":"Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data","venue":"cs.CL","work_id":"7e672e5e-85f5-45c4-a6ed-af2a428f82f3","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.166365Z"},"links":{"cited_paper":"/paper/2409.00238","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:bbdf8d94ef0bb21ce7d968d7c9bdbbdeb24246ac769faee8b7ae022b5318d24d","observation_id":"ae7971dd-e756-4e26-806c-a984f267b86f","resolution":{"observed_at":"2026-08-11T19:25:43.382459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.592138Z","title":"mplug- owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"cb5218d6-c994-4acb-8184-e81e4ebd1bde","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.169384Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:3069bc557b001ad9ba63ec8072e0877db0ad79449d098849ebfe9a1a2d5749fb","observation_id":"3360df2a-f264-483b-a0e7-ebf184c12dd5","resolution":{"observed_at":"2026-08-11T19:25:43.594949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-13T05:41:56.516364Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-11T19:25:43.171950Z","title":"Woodpecker: Hallucination correction for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.171950Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:b6dcf05019fce22d9374903ffe0871e988bce89c05ac1a8b1cf60d0ba8e67242","observation_id":"28f44c20-793f-4a94-b7c6-05a84db7b8d2","resolution":{"observed_at":"2026-08-11T19:25:43.171950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-11T19:25:43.175103Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.175103Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:a08ce247d34e4bc03f64c9ad9490bd222589c3517781a3e4dca6a6a4eea86bdb","observation_id":"a7ab8baf-6144-4cd6-8281-6141fef8bf2e","resolution":{"observed_at":"2026-08-11T19:25:43.175103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.581947Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":"3c0f3ee6-a20f-45fc-bbc3-a1cb8e045f2e","year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.178600Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:2325adb4d78a31ecd45091e1ea00996c088749dfbc366d1bab5524b3e2939689","observation_id":"c94e7fb9-987a-4297-bd94-65d4991185b1","resolution":{"observed_at":"2026-08-11T19:25:43.585237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.571537Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":"63850691-e5dd-4355-a22f-2abd1d2320d2","year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.181785Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:fb3a4425d930c226f35750d16f7b34c93737733dca2cb1605804773a21e0a9c4","observation_id":"20098fa2-ecb5-4a83-ba0a-e6e265ed529f","resolution":{"observed_at":"2026-08-11T19:25:43.574964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T19:25:43.184557Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.184557Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:debe106d06d13c0a297bc5b71c40adb143f22c66f9dfe58025bf92b8e735a7e2","observation_id":"68b1fe6a-a384-478b-a78c-31c6aa5c3320","resolution":{"observed_at":"2026-08-11T19:25:43.184557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-08-13T04:08:04.320949Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-11T19:25:43.187709Z","title":"Ibd: Alleviating hallucinations in large vision- language models via image-biased decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.187709Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:70fe90cdab1f2fd525835c0bf90d659829a7025c3a1610c67e9325518fac7124","observation_id":"1fb9c95c-e5dc-4708-8d9b-19e0c2b911de","resolution":{"observed_at":"2026-08-11T19:25:43.187709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.559879Z","title":"Plausibility Constraints Based on the contrastive decoding process from (2) in the main paper, it may penalize the entire LVLM’s responses via contrast samples","venue":null,"work_id":"42fca85b-015d-4cd7-9fbf-18992927e5be","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.190953Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:29bdfbca1b0601f5c45aa693b91387670112e4ef3d600c949c59cf9633a1b59f","observation_id":"831ac5bc-2f96-46d7-bdc8-6803ad0684e1","resolution":{"observed_at":"2026-08-11T19:25:43.563475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.549847Z","title":null,"venue":null,"work_id":"c8db08b6-4c16-404b-8e39-e76737da4cc0","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.194348Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:f5d5d6c2d0cbe2551f5b02eeacee553f9b8ac9910dfff9ef5fc5da50feaf6b9e","observation_id":"5eb55751-7d34-4c60-878d-00f6257c8ecc","resolution":{"observed_at":"2026-08-11T19:25:43.552788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.540258Z","title":null,"venue":null,"work_id":"479cbf7a-2d09-4e84-ada0-1340209d27af","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.197162Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:18c217858fdaa5f56cb53a5278667f9a51992429022d950749c79a118980b021","observation_id":"09ac97af-cd7b-493c-a1b9-be8ddf09ac0a","resolution":{"observed_at":"2026-08-11T19:25:43.543334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.530937Z","title":null,"venue":null,"work_id":"8ce4c66a-5e79-47de-8bf8-3ecdad0f0525","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.200040Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:fc0b0332625aba9877f6fe6bfe4941967640580900907cdd9ea8f4791d1ae2f3","observation_id":"fbfba72a-201b-4890-973e-96ac3978e181","resolution":{"observed_at":"2026-08-11T19:25:43.533776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.520291Z","title":null,"venue":null,"work_id":"299cd29f-0829-4deb-9d00-ab5c4fdb4bb4","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.203472Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:20ee040f24665e09359a0784d7a7d69cdea115bf20ecace1efd13085798b0993","observation_id":"c688789c-92c3-4912-a866-9ec0dfa2e164","resolution":{"observed_at":"2026-08-11T19:25:43.523482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.510108Z","title":"Different from InstructBLIP, the no image method has a much lower PDD value, which could result from the difference in answering tendency (as shown in Figure 10)","venue":null,"work_id":"a79e86fd-1f59-4717-9fcf-288953abdf80","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.206881Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:f9b93e724fd9736f7caf69dcfc43c990a47420223555c92233750ffa3d0e1951","observation_id":"0f2c9c0a-708b-46bc-94c9-da7f48462323","resolution":{"observed_at":"2026-08-11T19:25:43.513722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.499077Z","title":"yes” while LLaV A-1.5 is prone to answering “no","venue":null,"work_id":"6de85379-57d4-49df-899f-e7b277bbcfff","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.209798Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:d59f3a6ce8253d2809c8564c015a832fe1688514780cfb9d5c6b2782d49bff1f","observation_id":"2d71bfad-baf8-4c3d-957d-6ca73ecbaaaf","resolution":{"observed_at":"2026-08-11T19:25:43.502328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.489128Z","title":null,"venue":null,"work_id":"d092fec5-1179-4516-9814-bb380f7e9882","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.212821Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:bd5b44e1e91d269528151b48b9cf624536413000f1bc516b9cb66e45fb0ad6b0","observation_id":"8e340e3a-e044-4d68-9e1f-1ab77e676cfe","resolution":{"observed_at":"2026-08-11T19:25:43.492136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.479377Z","title":"On the POPE benchmark, the overlap between downsample and diffusion noise is higher","venue":null,"work_id":"455f2928-ba0a-4670-bd61-d4908b8194ba","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.215761Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:0e14606ff5d60891ec0311ff56d5b32add829e63030308d9bd438048bbf3ce83","observation_id":"20509efa-8636-4451-86d7-41306f20a363","resolution":{"observed_at":"2026-08-11T19:25:43.482952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.469047Z","title":null,"venue":null,"work_id":"5b92f0f7-48cc-4a32-8dfd-6451e5e2dd31","year":null},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.218830Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:054e514f7e6c1aac6bdf5a63f058f01ff11a24999fc1cf7036eca57045314649","observation_id":"8256bca8-8fb4-4f88-b76c-a58583ffaa13","resolution":{"observed_at":"2026-08-11T19:25:43.472491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8790.8170","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:25:43.318740Z","title":"We automatically cap- ture the objects or revise the questions to the affirmative sentences as the editing textual instructions","venue":null,"work_id":"6afb804d-3204-4302-b392-173a2c01dfb8","year":2001},"citing_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:25:43.222317Z"},"links":{"citing_paper":"/paper/2412.06775"},"observation_digest":"sha256:f362f0bb287ebe7488b60417972f489c5c80dcfae63e3b02d149184653e2d5d2","observation_id":"933899e9-49b6-44d5-9e8d-446baf9fbe38","resolution":{"observed_at":"2026-08-11T19:25:43.326114Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T10:53:14.948544Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 6 inbound Pith citation observations for arXiv:2412.06775."}