{"as_of":"2026-08-08T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:762a6756f8ca694743de98c04525cc1c4d535bfcd437fef05388c0c888a28c67","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:03:30.301678Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T23:51:47.724033Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"cited_work":{"arxiv_id":"2505.16652","doi":"10.48550/arxiv.2505.16652","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"078ecf3f-a2c8-4e81-a23f-7c0a900f7f42","year":null},"citing_paper":{"arxiv_id":"2604.21027","last_updated":"2026-08-02T16:15:42Z","snapshot_observed_at":"2026-08-06T23:24:26.820832Z","submitted_at":"2026-04-22T19:18:36Z","title":"HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering","version":1},"reference_index":274,"source":"arxiv_source","source_observed_at":"2026-05-09T23:51:47.724033Z"},"links":{"cited_paper":"/paper/2505.16652","citing_paper":"/paper/2604.21027"},"observation_digest":"sha256:f12e7727537c9254daf5d8a7d973d3469f72b02d806959584549b8e37cc8ea9a","observation_id":"4d23faf3-f55c-429d-a650-7bf14bd40f36","resolution":{"observed_at":"2026-05-09T23:54:45.721877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16652/citation-record","integrity":"/paper/2505.16652/integrity","json":"/paper/2505.16652/citation-record.json","paper":"/paper/2505.16652"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T15:03:19.770573Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:19.770573Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:d418d1560e394ebcfbabad85f991015ddd08109a39669aa89e7b1bd4ad90ba05","observation_id":"d23f53f2-0e80-4ab2-bd0b-68d94d3b3213","resolution":{"observed_at":"2026-08-07T15:03:19.770573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:19.840114Z","title":"Wiki-llava: Hierarchical retrieval-augmented generation for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:19.840114Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:54387d98b42120b6566d43276c7e72e664fd8824f9a8843c3b2492f9c0d00185","observation_id":"2c91fb18-5a55-4cf9-86b7-e4872a1705cf","resolution":{"observed_at":"2026-08-07T15:03:19.840114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T15:03:19.977884Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:19.977884Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:992f12d10c1e7877ec07cffa907c631de791ad76af8ed79a8756f916453f6943","observation_id":"6c64b351-e33c-4662-9e2d-6d148fe1668c","resolution":{"observed_at":"2026-08-07T15:03:19.977884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T15:03:20.051069Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.051069Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:1fc02076bda81da641291f203cff6519932e49d074e24985be9e7e19e140c3a4","observation_id":"502f045d-e5bc-40b2-ba6b-1f0a54df2752","resolution":{"observed_at":"2026-08-07T15:03:20.051069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:03:20.133939Z","title":"Videollama 2: Advanc- ing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.133939Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:93a6350d3fe34d2c9b362daa8bd8a5cb31a058d3833719bae6eddce2eeeab5d8","observation_id":"0e95152e-7ebe-4149-ad62-535492fb4039","resolution":{"observed_at":"2026-08-07T15:03:20.133939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:20.179160Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.179160Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:5c5d40eb5748c245dff7d1a4b436e6ea90e63622ac8c7b6b719bbe3578734606","observation_id":"1cf79433-6b9b-4b5e-8dc8-34634e0d97ed","resolution":{"observed_at":"2026-08-07T15:03:20.179160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13115","last_updated":"2023-03-29T18:26:34Z","snapshot_observed_at":"2026-07-06T13:14:06.120131Z","submitted_at":"2022-05-26T02:46:09Z","title":"Fine-grained Image Captioning with CLIP Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13115","snapshot_observed_at":"2026-08-07T15:03:20.260110Z","title":"Fine- grained image captioning with clip reward.arXiv preprint arXiv:2205.13115, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.260110Z"},"links":{"cited_paper":"/paper/2205.13115","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:b1c31bf19aec93aa1f91f6b59ef9fb35f763005898acc4794e7d82766609b60e","observation_id":"983bf124-daaa-4ea4-b362-a13ce4860e92","resolution":{"observed_at":"2026-08-07T15:03:20.260110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-08-07T15:03:20.327714Z","title":"Dola: Decoding by con- trasting layers improves factuality in large language mod- els.arXiv preprint arXiv:2309.03883, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.327714Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:505167c778faa8a13d0d3bf5cdfcd4c385450972ee645ab3e37dfdbf963e31b0","observation_id":"44ee6383-35e4-46ce-ab0b-6aa13a2dc0b1","resolution":{"observed_at":"2026-08-07T15:03:20.327714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:20.485861Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.485861Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:267d78b5b563df7680a07dd437c4be94a0710512b7ebaf1d4f468445d2a395d2","observation_id":"ae458081-5b74-4f6d-856e-2bd5c06560cf","resolution":{"observed_at":"2026-08-07T15:03:20.485861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-07T15:03:20.594782Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and compre- hension in vision-language large model.arXiv preprint arXiv:2401.16420, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.594782Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:c5ed491a3610e747283855ef08601fc1763104fa05f3eab535488989f5063f9f","observation_id":"b49f80b0-80eb-447e-824a-037c1d63326c","resolution":{"observed_at":"2026-08-07T15:03:20.594782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-08T01:15:44.293937Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-07T15:03:20.690012Z","title":"Layer skip: Enabling early exit inference and self- speculative decoding.arXiv preprint arXiv:2404.16710,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.690012Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:9e9d797ea5eb6c14668024ebf459132a296466598cc1379683c7a2ae33a042a6","observation_id":"70cfe156-4315-4595-bc26-fafad5d8358f","resolution":{"observed_at":"2026-08-07T15:03:20.690012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:20.794045Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.794045Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:8fa28cb348afb228fee4921eb9094cfe960ee2ce377b7c1c68a21deb573b84a2","observation_id":"3e991a05-b7d3-44da-b212-580538a3440b","resolution":{"observed_at":"2026-08-07T15:03:20.794045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00367","last_updated":"2024-07-01T01:34:09Z","snapshot_observed_at":"2026-08-05T02:20:52.778218Z","submitted_at":"2024-02-01T06:11:49Z","title":"Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00367","snapshot_observed_at":"2026-08-07T15:03:20.864651Z","title":"Don’t hallucinate, abstain: Identifying llm knowledge gaps via multi-llm col- laboration.arXiv preprint arXiv:2402.00367, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.864651Z"},"links":{"cited_paper":"/paper/2402.00367","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:5a9c56519bca0d4737812eef6b48cfaeb3dd725f4138a34ec59f54080a4280d7","observation_id":"1118e2c1-0302-482a-9737-069fb582d3b6","resolution":{"observed_at":"2026-08-07T15:03:20.864651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:20.941996Z","title":"Instructdiffusion: A gener- alist modeling interface for vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:20.941996Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:2eb85bee7e74c3dbea1f68eb1513dc47cff15524a9ce4b82341b7130f21b129c","observation_id":"f1964c61-00e8-48ee-bdb4-a1162f186914","resolution":{"observed_at":"2026-08-07T15:03:20.941996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.018310Z","title":"Medsumm: A multimodal approach to summarizing code-mixed hindi- english clinical queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.018310Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:5755724b358719d2cba27967ddab965d8373ec8e303a1f6c588988ae1d56d37c","observation_id":"dc27d80e-ebfd-4ed3-ac40-e7b9176a4f47","resolution":{"observed_at":"2026-08-07T15:03:21.018310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.098044Z","title":"Exploring the frontier of vision- language models: A survey of current methodologies and future directions.arXiv preprint arXiv:2404.07214, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.098044Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:f44258811f2d48bc5f0ca4a0658d7eca3a1563e940b2dc1db01ca7010cae1e83","observation_id":"8807f823-a1e3-4fe3-92f0-1203ed190709","resolution":{"observed_at":"2026-08-07T15:03:21.098044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-07T15:03:21.193304Z","title":"Sequence transduction with recurrent neural networks.arXiv preprint arXiv:1211.3711, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.193304Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:577f55a535661c44b70937d9d16280cf26f276c2bfcf57b195c92f0b92d9b887","observation_id":"c5e4965a-5719-49c7-85aa-1ac67756c3cc","resolution":{"observed_at":"2026-08-07T15:03:21.193304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.259722Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.259722Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:1aeedc463c7da5e8792bcf4fb6ff450981928aec0bd202442c79e15c5cd7b768","observation_id":"091df255-e653-4d95-ba33-fecbf9168d53","resolution":{"observed_at":"2026-08-07T15:03:21.259722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.350412Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.350412Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:fa73c4ef0e4be0f9b215aa97f2d1587bd3693810e595819e5d338b6c1c8833b1","observation_id":"f645a362-3d5a-4294-a128-edfbeba927de","resolution":{"observed_at":"2026-08-07T15:03:21.350412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02301","last_updated":"2023-11-24T07:07:03Z","snapshot_observed_at":"2026-08-03T03:23:08.919296Z","submitted_at":"2023-09-05T15:06:37Z","title":"CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02301","snapshot_observed_at":"2026-08-07T15:03:21.475936Z","title":"Ciem: Contrastive instruction evaluation method for better instruction tuning.arXiv preprint arXiv:2309.02301,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.475936Z"},"links":{"cited_paper":"/paper/2309.02301","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:ca65766fa694615e528cfd93e8c15b028615a25cfe9b7b69fb79448f057cca8f","observation_id":"f899b9f7-38a3-4561-98ed-0208489d5045","resolution":{"observed_at":"2026-08-07T15:03:21.475936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-07T15:03:21.575918Z","title":"A survey on hallucination in large language models: Principles, tax- onomy, challenges, and open questions.arXiv preprint arXiv:2311.05232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.575918Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:e50720622dd1ed4d0f2ebb87e44b95abe40688d26c59fa8193169ca5f051780e","observation_id":"6857b284-e072-4d24-a64b-cf1d035559df","resolution":{"observed_at":"2026-08-07T15:03:21.575918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.653882Z","title":"Diversity-aware meta visual prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.653882Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:08d66831630c47e7b070a372bd9a9da4c4db09a974469328462e5de10e48ecb0","observation_id":"99577d32-66ba-40f5-86e3-de65a391090b","resolution":{"observed_at":"2026-08-07T15:03:21.653882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.751897Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.751897Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:b76e6d452a97d17303fe795277acc19c069aa12f8b18633d3c1991a7e528c39d","observation_id":"ea8bab2f-73a1-45ac-bf5e-406fbffc1096","resolution":{"observed_at":"2026-08-07T15:03:21.751897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-06T05:55:18.425562Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-07T15:03:21.827608Z","title":"Self-introspective decod- ing: Alleviating hallucinations for large vision-language models.arXiv preprint arXiv:2408.02032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.827608Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:5b70c5e362da02b556bc8ef808eb44a778d2a72716aa96ed121a76f950892cfa","observation_id":"c8ea5553-99ea-443d-ae33-2e4dd930f72c","resolution":{"observed_at":"2026-08-07T15:03:21.827608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.907491Z","title":"Vcoder: Ver- satile vision encoders for multimodal large language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.907491Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:92c3d7d92d47389bd4fb834428de28dc9243c1afad2706cd0228baf3524dceee","observation_id":"8ce8bb45-f946-4b84-a6d7-1c01dcc9c905","resolution":{"observed_at":"2026-08-07T15:03:21.907491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:21.973438Z","title":"Survey of hallucination in natural language generation.ACM Computing Surveys, 55(12):1–38, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:21.973438Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:ad293dd61045bd0e0c18df83c91ca3347458df173a81ff292b3ea0e0f6378870","observation_id":"eb65b76b-9302-47ea-b66e-6e192aa6bae0","resolution":{"observed_at":"2026-08-07T15:03:21.973438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:22.049563Z","title":"Hallucination augmented contrastive learn- ing for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.049563Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:8c6e9199872f8a25581dc0e67e8541767bc95b9961c8513104f11684f9b28c25","observation_id":"459f0994-7577-44e8-9f03-8f231c8de0b1","resolution":{"observed_at":"2026-08-07T15:03:22.049563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:22.195396Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.195396Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:13def49b88be53e90c19347fb841cee5e9fc4dbd35a24eaf1911630140a9d4db","observation_id":"3e4f4d98-3a78-4754-95d2-f1379565bfe5","resolution":{"observed_at":"2026-08-07T15:03:22.195396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:22.322023Z","title":"Prov- able memorization capacity of msrvtt-qa","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.322023Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:ce16b82bd410e32d0faa42f6867a65b699ee509ae3e8364b0bcc2aa2f98873b9","observation_id":"edcc98b6-1aa8-4d46-9331-e76619db3d84","resolution":{"observed_at":"2026-08-07T15:03:22.322023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:22.434952Z","title":"Instructive decoding: Instruction-tuned large lan- guage models are self-refiner from noisy instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.434952Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:27aef6f0ebf571d3c2225a3af8dccb3f2dbe47b5d64f721c72b6e2ace642bd94","observation_id":"6bc61b96-ef38-47c8-8c5d-711e11746c17","resolution":{"observed_at":"2026-08-07T15:03:22.434952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:22.501290Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.501290Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:500a7d22db47d73bce40de88041fed2f630e9e77eb0b51f0949e85a0a37f8eb2","observation_id":"29fda0f7-0ec1-4eee-b4c5-202b66bb1b87","resolution":{"observed_at":"2026-08-07T15:03:22.501290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:22.558038Z","title":"Factuality enhanced lan- guage models for open-ended text generation.NeurIPS, 35: 34586–34599, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.558038Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:4c61dfe6d0693608babb7319ab9b1b595fdc798fd6986ce06594c2399f1b3dcc","observation_id":"c24cfef3-4c70-4e2f-9ccc-28d47f804e43","resolution":{"observed_at":"2026-08-07T15:03:22.558038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:38.282356Z","title":"Mitigating object hallucinations in large vision-language models through vi- sual contrastive decoding","venue":null,"work_id":"c19e1ac3-aa41-4b12-99be-c5b6a70e57ae","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.630498Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:355087ab691fc379cf8abaab239ecf7df6a0c6581718864c541478c05b437f83","observation_id":"584f7466-29e5-47ca-bafc-2e52bc410949","resolution":{"observed_at":"2026-08-07T15:03:38.422622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:03:22.686403Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.686403Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:f5df3e667a5d66b1fb661c91fbb5a46dd93c3137d214023511a0a341660f2e0e","observation_id":"1bab3bb1-5499-490c-abfd-3f732d124096","resolution":{"observed_at":"2026-08-07T15:03:22.686403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15097","last_updated":"2023-07-10T06:08:55Z","snapshot_observed_at":"2026-07-06T14:10:59.567758Z","submitted_at":"2022-10-27T00:58:21Z","title":"Contrastive Decoding: Open-ended Text Generation as Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15097","snapshot_observed_at":"2026-08-07T15:03:22.810607Z","title":"Contrastive decoding: Open-ended text gen- eration as optimization.arXiv preprint arXiv:2210.15097,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.810607Z"},"links":{"cited_paper":"/paper/2210.15097","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:ae6b98b1053dcd5851d17983a601002cabb0e9cd228d899d9c421985e01b9d79","observation_id":"4dd23eff-3d80-42fb-b484-bd080dd491dc","resolution":{"observed_at":"2026-08-07T15:03:22.810607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:37.988093Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"a076aeb4-ff4d-490c-945a-9ca87a663625","year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:22.887904Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:b4193fde246e60432f583b5163b70a9d59ff1e0d445b47eaca5c41696c9cdadf","observation_id":"7f46f14f-64b2-47d4-b692-a2bd6f36a557","resolution":{"observed_at":"2026-08-07T15:03:38.125432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T15:03:23.007971Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.007971Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:6b8dab0fc22310181e807941930cbfd44d34f470bdfc689d58f576a1e4bff5a5","observation_id":"26e76795-80b3-4000-81f2-799214232bb2","resolution":{"observed_at":"2026-08-07T15:03:23.007971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:37.728105Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"da302b5d-6e27-4588-a806-5f41db3fc047","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.176818Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:7c00fa64d0470a49e476798f4836f4a98835b00650bb45a4d961043b9da59af1","observation_id":"0b021a32-49be-4a77-9454-b8c85f30648d","resolution":{"observed_at":"2026-08-07T15:03:37.916331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T15:03:23.331553Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.331553Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:ad92d3addca89978c02ccc8d3f992cc86ab4a3a92f7c3a0429fc68a9360279f6","observation_id":"df7bc4f3-da74-46a8-8e91-a393b5344398","resolution":{"observed_at":"2026-08-07T15:03:23.331553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:37.504986Z","title":"Vila: On pre-training for visual language models, 2023","venue":null,"work_id":"ac9a79fc-1659-47ca-be24-a907ff6c0fbd","year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.401997Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:f6fb71d8ae8d9d4e6bfd08cab14dc9c70bf5951e58b48517d2e0680b47f3a319","observation_id":"3a30dd39-42ae-4820-8f24-2c290d9b0145","resolution":{"observed_at":"2026-08-07T15:03:37.590402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-07T15:03:23.464262Z","title":"Aligning large multi-modal model with robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.464262Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:523ba47567ee182c2330f956081b6bb0446672422f65d43d8d8c6dda6e7988f8","observation_id":"ce375032-e415-4a2e-ae28-486958255b05","resolution":{"observed_at":"2026-08-07T15:03:23.464262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:37.214384Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"54f32bb8-9d5b-41f3-a5ed-729ec863406c","year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.593529Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:c00088342c41c3bf4bf330f3ec088a5aed987fd1cb1170cc8bf4f982abbbe7c3","observation_id":"11d7b8dc-834d-4492-baac-39173ea4a923","resolution":{"observed_at":"2026-08-07T15:03:37.317149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:37.079326Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"daf4550b-a307-4551-953d-5ea41e2e2bb1","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.705778Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:585deaf2e931518dc9af129234f338a6cabb2fa49beb632a9c8ec1e2be010ab9","observation_id":"39adf377-9bec-4b07-bebe-a7aa3208ec6f","resolution":{"observed_at":"2026-08-07T15:03:37.148407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:36.808197Z","title":"Visual instruction tuning.Advances in neural infor- mation processing systems, 36, 2024","venue":null,"work_id":"560ac1f7-f808-4906-96df-d22b730eb27a","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.821918Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:4d125eb26cdbab9a968e507674942a5624f00b930e51312d5305181e8b774453","observation_id":"3aecf81d-45cd-4a79-af05-380f7881ba8b","resolution":{"observed_at":"2026-08-07T15:03:36.924196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-07T15:03:23.885022Z","title":"A survey on hallucination in large vision-language models.arXiv preprint arXiv:2402.00253, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.885022Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:bf28b9ebdb268279f3a1d8c03e4c2ff5891fd190682395f73c3a27854fe9aa54","observation_id":"26d80c7e-5090-4850-a1f7-ee2b8effc5ed","resolution":{"observed_at":"2026-08-07T15:03:23.885022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11116","last_updated":"2025-04-14T12:11:51Z","snapshot_observed_at":"2026-08-03T16:32:32.602866Z","submitted_at":"2024-03-17T06:53:44Z","title":"PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11116","snapshot_observed_at":"2026-08-07T15:03:23.949942Z","title":"Phd: A prompted visual hallucination evaluation dataset.arXiv preprint arXiv:2403.11116, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:23.949942Z"},"links":{"cited_paper":"/paper/2403.11116","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:48b1a6aa7f6084ac50f5ef758129029784903fa128830a2f2c482d03f7a4330a","observation_id":"ae07e378-1f65-4e3f-8905-ad4b387f0dc7","resolution":{"observed_at":"2026-08-07T15:03:23.949942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21771","last_updated":"2024-07-31T17:46:57Z","snapshot_observed_at":"2026-08-06T11:42:03.713360Z","submitted_at":"2024-07-31T17:46:57Z","title":"Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21771","snapshot_observed_at":"2026-08-07T15:03:24.001242Z","title":"Paying more atten- tion to image: A training-free method for alleviating hallu- cination in lvlms.arXiv preprint arXiv:2407.21771, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.001242Z"},"links":{"cited_paper":"/paper/2407.21771","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:6e1e5e2cc60b11569af3c5e25eae2da8ceab47a7e25a251a6193b88ac49bc1bc","observation_id":"a64e5c6d-92b6-4a91-9844-51687fcfa068","resolution":{"observed_at":"2026-08-07T15:03:24.001242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10638","last_updated":"2025-03-19T05:52:59Z","snapshot_observed_at":"2026-08-02T17:34:42.623267Z","submitted_at":"2024-06-15T13:58:26Z","title":"Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10638","snapshot_observed_at":"2026-08-07T15:03:24.060688Z","title":"Seeing clearly, answering incorrectly: A multimodal robustness benchmark for evaluating mllms on leading questions.arXiv preprint arXiv:2406.10638,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.060688Z"},"links":{"cited_paper":"/paper/2406.10638","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:7abe8a6ac38422f841daef9b2fadf0dfcbc30d7f92d6cfcffa80e56b322a2b78","observation_id":"17d08fd7-77a5-4d67-b417-3bfdbf71630e","resolution":{"observed_at":"2026-08-07T15:03:24.060688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:36.557544Z","title":"Mmbench: Is your multi- modal model an all-around player? InEuropean Confer- ence on Computer Vision, pages 216–233","venue":null,"work_id":"2f21bf6a-525c-4209-af31-81a1487987a0","year":2025},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.168265Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:7ba6222f60e0233ae8fe2cd6e08229cd2cf85ba8ba2f4fcbdd6396a2be1dce4a","observation_id":"d3eba227-0a78-4f3a-8837-3ebc2dfa044d","resolution":{"observed_at":"2026-08-07T15:03:36.696455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:36.303238Z","title":"Learn to explain: Multimodal rea- soning via thought chains for science question answering","venue":null,"work_id":"6f9060a2-7200-4400-980f-79960aa88c46","year":2022},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.287729Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:c1a1c5cafeef89d06b3e2e628972663d8b7f083b4108e828b90c3fa80ea48561","observation_id":"06b4c774-7fe0-4669-8bc2-7c5626e8224a","resolution":{"observed_at":"2026-08-07T15:03:36.410284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:36.012617Z","title":"Vista-llama: Reducing hallucination in video language models via equal distance to visual to- kens","venue":null,"work_id":"075a4f20-7121-4f01-8910-e43a6af6c20d","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.365385Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:fcd0d79f9d494f08f8f17a50822b3fea45871aaad91de8bbefeba5e332c29f33","observation_id":"34d2350f-0668-4132-aa6d-13956105bb84","resolution":{"observed_at":"2026-08-07T15:03:36.100183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:35.718414Z","title":"Vista-llama: Reducing hallucination in video language models via equal distance to visual tokens","venue":null,"work_id":"a02c0899-0dfe-415e-8907-2731f0c4970d","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.493427Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:0be2654e4024c931aff9f9402e77d2d8637f01a0b265865f8cbbad4beec38673","observation_id":"67807105-ed7a-43e6-a80f-c9407ea955eb","resolution":{"observed_at":"2026-08-07T15:03:35.904953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T15:03:24.639849Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.639849Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:23a61cf382e247dd8d33a709ff4c478239b6dff01a9d6040381ac48dc2ea5743","observation_id":"10314987-0fbc-4643-941d-b402fbee6f40","resolution":{"observed_at":"2026-08-07T15:03:24.639849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:35.390409Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"6a9a0c07-e01f-4db4-afa3-35bf760c7bd3","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.779123Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:2ec84bb3915134c58f915f780c23a9ed9f8c548d2392eea4ca4445432dc260b4","observation_id":"6d3fd347-0b41-4e1c-a90f-840739af0721","resolution":{"observed_at":"2026-08-07T15:03:35.532054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-08-07T15:03:24.943812Z","title":"Selfcheckgpt: Zero-resource black-box hallucination detec- tion for generative large language models.arXiv preprint arXiv:2303.08896, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:24.943812Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:a2149a17a0ff358d343f2963fff14f212ce8184a5c16e7a9cf7ed511ec2998bf","observation_id":"73d3b7b6-cbcd-4a5c-b057-8e7f68825568","resolution":{"observed_at":"2026-08-07T15:03:24.943812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-07T15:03:25.101268Z","title":"Mm1: Meth- ods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:25.101268Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:14941081490846b678cf00e84cb09511a71c0935413621a45b6e0b960149259c","observation_id":"b3d02633-9be4-4692-80de-134a95a7d6fe","resolution":{"observed_at":"2026-08-07T15:03:25.101268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:35.033801Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":"1a1d2dae-5abe-4467-9c9c-6b79affe0a8b","year":2022},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:25.350570Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:1e1d259844b0371aea776c3013c2cb28ba582040d88ea5c3326b6c13a619aa5a","observation_id":"9e3628c9-c5ac-4dfd-aa92-9ad1acfa360e","resolution":{"observed_at":"2026-08-07T15:03:35.201173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-07T15:03:25.491533Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation.arXiv preprint arXiv:2108.12409, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:25.491533Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:a7a90af817f466d47fd5dc0146c7ae3b314ecf3a7c50009c059087c097b6227c","observation_id":"55db4ed6-38fd-48d6-8dc8-8dae21a3f442","resolution":{"observed_at":"2026-08-07T15:03:25.491533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:34.792812Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.The Journal of Ma- chine Learning Research, 21(1):5485–5551, 2020","venue":null,"work_id":"2b001657-c119-4e53-8c53-9eb6831f9cd6","year":2020},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:25.674147Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:9f5013cd279946d945b47d883811496e4312fb15021446b9ae37ddcd2cbc811c","observation_id":"00432ec0-ea6d-4a31-8b0c-e5a9edde1cf4","resolution":{"observed_at":"2026-08-07T15:03:34.900150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:34.583756Z","title":"Object hallucination in image captioning","venue":null,"work_id":"f0c82395-8d51-4451-9947-bebb4e0b8112","year":2018},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:25.836439Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:2ce7f76cc8acc02b02ca93428ce616c84ecf8e7cf247efb6be7ae76ea8f90a2b","observation_id":"9cb3c8b3-090f-4059-86dc-e81f95d2d6ae","resolution":{"observed_at":"2026-08-07T15:03:34.668279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15766","last_updated":"2024-05-27T02:55:45Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-24T17:58:42Z","title":"Enhancing Adverse Drug Event Detection with Multimodal Dataset: Corpus Creation and Model Development","version":2},"cited_work":{"arxiv_id":"2405.15766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15766","snapshot_observed_at":"2026-08-07T15:03:31.057764Z","title":"Enhancing Adverse Drug Event Detection with Multimodal Dataset: Corpus Creation and Model Development","venue":"cs.AI","work_id":"a2942369-ab9d-4a15-bb70-a3a85d745bf9","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:26.018483Z"},"links":{"cited_paper":"/paper/2405.15766","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:933c9622f4a737d2d90035b0c17ed938a346dabcf5ac9198f89f5f43d273363f","observation_id":"dc093ae9-3d08-4a7b-ba04-822102d26e71","resolution":{"observed_at":"2026-08-07T15:03:31.181173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18654","last_updated":"2025-02-28T00:26:42Z","snapshot_observed_at":"2026-08-04T21:04:25.264907Z","submitted_at":"2024-05-28T23:36:00Z","title":"Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18654","snapshot_observed_at":"2026-08-07T15:03:26.186307Z","title":"Mitigating object hallucination via data augmented contrastive tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:26.186307Z"},"links":{"cited_paper":"/paper/2405.18654","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:464defbd8ad69f055d92fa0c29808d2f018c80256c249327e1649a59c898d142","observation_id":"13883887-e87a-4beb-b2e6-8d9f3efe0886","resolution":{"observed_at":"2026-08-07T15:03:26.186307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07567","last_updated":"2021-04-15T16:24:43Z","snapshot_observed_at":"2026-08-08T00:34:53.168974Z","submitted_at":"2021-04-15T16:24:43Z","title":"Retrieval Augmentation Reduces Hallucination in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07567","snapshot_observed_at":"2026-08-07T15:03:26.272534Z","title":"Retrieval augmentation reduces hallu- cination in conversation.arXiv preprint arXiv:2104.07567,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:26.272534Z"},"links":{"cited_paper":"/paper/2104.07567","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:73f9e43d8f18aea60ba10dcffbb3221f0cbf40abd81cb70be6e81b9427f815a3","observation_id":"f11259f3-fbff-4be3-9342-cff884aae682","resolution":{"observed_at":"2026-08-07T15:03:26.272534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T15:03:26.469891Z","title":"Roformer: Enhanced trans- former with rotary position embedding.arXiv preprint arXiv:2104.09864, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:26.469891Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:6cec9a1097c82722145256a9f4c7c10d66791d29621d768b18dbac31fe02ac3e","observation_id":"f4dd9749-d071-4ba1-87ce-4314f8c8b285","resolution":{"observed_at":"2026-08-07T15:03:26.469891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:34.345686Z","title":"Intervening anchor token: Decod- ing strategy in alleviating hallucinations for MLLMs","venue":null,"work_id":"b9f44a94-e959-4103-be3b-6b48da77a5b3","year":2025},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:26.654834Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:25c52ec7e41f1ecbf0e21d4988a25c65e764f1130873f8d00c56754aa453561d","observation_id":"843cc290-ba73-41ae-9db9-c482a8ef1168","resolution":{"observed_at":"2026-08-07T15:03:34.482930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T15:03:26.756185Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:26.756185Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:19448f7d453c44924045175816d1fdb56dc23cfe40d386824ebfdeb5e5374f36","observation_id":"b5c93d38-158e-4801-ace1-7429328f6422","resolution":{"observed_at":"2026-08-07T15:03:26.756185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:03:27.080877Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.080877Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:bb4ff308e3f6af4876c659eed4c6b145eae820ea2f802ecd90ca36f606dff088","observation_id":"4ffb8b9a-bac6-420a-a6dd-812cd0dac30a","resolution":{"observed_at":"2026-08-07T15:03:27.080877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:33.919298Z","title":"Attention is all you need.NeurIPS, 30, 2017","venue":null,"work_id":"7c3ad260-81a7-42ac-a2f1-5e7a388ab520","year":2017},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.168556Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:b9a5ddf3d649aca668e86f7ef8934d95f414cc3d827f673bc965f416f7c67148","observation_id":"d41c769a-2ef3-4d64-ac5f-57a8dfb72dcc","resolution":{"observed_at":"2026-08-07T15:03:34.119962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15126","last_updated":"2023-10-10T11:57:26Z","snapshot_observed_at":"2026-08-01T17:12:16.290540Z","submitted_at":"2023-08-29T08:51:24Z","title":"Evaluation and Analysis of Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15126","snapshot_observed_at":"2026-08-07T15:03:27.327901Z","title":"Evaluation and analysis of hal- lucination in large vision-language models.arXiv preprint arXiv:2308.15126, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.327901Z"},"links":{"cited_paper":"/paper/2308.15126","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:2c6f550b6ea27905c671d03ec269d4ce6525bb3cb57e95280aaa3e6f1e282fc9","observation_id":"1243257a-a519-46b3-ae4d-09e4b866d59b","resolution":{"observed_at":"2026-08-07T15:03:27.327901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18715","last_updated":"2024-06-05T13:53:42Z","snapshot_observed_at":"2026-08-08T12:24:47.968940Z","submitted_at":"2024-03-27T16:04:47Z","title":"Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18715","snapshot_observed_at":"2026-08-07T15:03:27.505799Z","title":"Mitigating hallucinations in large vision-language models with instruction contrastive decoding.arXiv preprint arXiv:2403.18715, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.505799Z"},"links":{"cited_paper":"/paper/2403.18715","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:7f0dc4c103106ac003659332b0e4845a1d65d0fdd2535762621ca2b5a1ca1f46","observation_id":"0340ce12-f89f-4adc-ad16-dc902035e0d6","resolution":{"observed_at":"2026-08-07T15:03:27.505799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-07T15:03:27.605445Z","title":"Self-instruct: Aligning language models with self- generated instructions.arXiv preprint arXiv:2212.10560,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.605445Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:3ed64b15aff1d1fd805a51420398c731eaa0140b65ce2771ce6b606f4e8192aa","observation_id":"a411a925-6063-4579-bdda-4f4889885973","resolution":{"observed_at":"2026-08-07T15:03:27.605445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11622","last_updated":"2024-06-28T07:20:22Z","snapshot_observed_at":"2026-08-06T20:50:51.333330Z","submitted_at":"2024-02-18T15:28:39Z","title":"Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11622","snapshot_observed_at":"2026-08-07T15:03:27.741065Z","title":"Logical closed loop: Uncovering object hallucinations in large vision-language models.arXiv preprint arXiv:2402.11622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.741065Z"},"links":{"cited_paper":"/paper/2402.11622","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:a6f2b872fdb14c8ae2bd6d69115a14fa7f009ce62a8d0167cc9419f067b19afe","observation_id":"781dcc68-97e9-48c0-a037-4d2e467f9977","resolution":{"observed_at":"2026-08-07T15:03:27.741065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14233","last_updated":"2025-01-06T13:58:45Z","snapshot_observed_at":"2026-08-08T04:34:12.314538Z","submitted_at":"2024-04-22T14:46:10Z","title":"Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14233","snapshot_observed_at":"2026-08-07T15:03:27.832973Z","title":"Detecting and mitigating hallucination in large vi- sion language models via fine-grained ai feedback.arXiv preprint arXiv:2404.14233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.832973Z"},"links":{"cited_paper":"/paper/2404.14233","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:37dd6149762a0275f847c29b06055f4883f0849136f4767fb38e3fc761231634","observation_id":"b83196bf-c051-4d16-b3fa-47a4e986b32d","resolution":{"observed_at":"2026-08-07T15:03:27.832973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15926","last_updated":"2024-10-21T11:54:53Z","snapshot_observed_at":"2026-08-08T00:09:35.155222Z","submitted_at":"2024-10-21T11:54:53Z","title":"Mitigating Object Hallucination via Concentric Causal Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15926","snapshot_observed_at":"2026-08-07T15:03:27.933933Z","title":"Miti- gating object hallucination via concentric causal attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:27.933933Z"},"links":{"cited_paper":"/paper/2410.15926","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:77307622e326f35969357c4df7e148304bb03f939b624e00f7557765bd6506e6","observation_id":"7c8f3bd6-a425-4342-8a02-1807d5796af7","resolution":{"observed_at":"2026-08-07T15:03:27.933933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:33.585067Z","title":"Xu, Zhou Zhao, Jun Xiao, Fei Wu, Hanwang Zhang, Xi- angnan He, and Yueting Zhuang","venue":null,"work_id":"b4d32c62-1c86-466f-866c-5142f4c098a9","year":2017},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.047675Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:00c9ae53f591ded2e0c2df9e727348f660dc79b321bf752dad473393d27020c2","observation_id":"15126a64-f264-45b9-a0c9-c533b5415f3a","resolution":{"observed_at":"2026-08-07T15:03:33.737938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11903","last_updated":"2025-03-08T12:36:34Z","snapshot_observed_at":"2026-08-07T18:12:04.893348Z","submitted_at":"2025-02-17T15:24:49Z","title":"MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11903","snapshot_observed_at":"2026-08-07T15:03:28.157713Z","title":"Mmrc: A large- scale benchmark for understanding multimodal large lan- guage model in real-world conversation.arXiv preprint arXiv:2502.11903, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.157713Z"},"links":{"cited_paper":"/paper/2502.11903","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:cc14f5b666fb8654b59b09706b51aaf3cb1b4901b5ade2673fe17a106b379729","observation_id":"188b50dc-fb5d-4f7f-bf0f-4b1e1fea118c","resolution":{"observed_at":"2026-08-07T15:03:28.157713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:33.337944Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"99f46653-f2fd-4702-8599-50be2c6a3dc8","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.256284Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:b89923792ea984e32ff7640f3c37449ac577c85d96166d5468cbcce5bfbbd6cf","observation_id":"59934a67-2ed4-436b-aff0-a48ce80132ec","resolution":{"observed_at":"2026-08-07T15:03:33.442051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04779","last_updated":"2024-02-07T12:01:02Z","snapshot_observed_at":"2026-08-01T20:40:21.545860Z","submitted_at":"2024-02-07T12:01:02Z","title":"StableMask: Refining Causal Masking in Decoder-only Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04779","snapshot_observed_at":"2026-08-07T15:03:28.377330Z","title":"Stablemask: Refining causal masking in decoder-only transformer.arXiv preprint arXiv:2402.04779, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.377330Z"},"links":{"cited_paper":"/paper/2402.04779","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:495edd67411674e8091563b8fbad983d831dece533b9b9384280871cb28932b1","observation_id":"2f3fbd5e-e1e4-4441-85fe-c254df22750a","resolution":{"observed_at":"2026-08-07T15:03:28.377330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-08T00:11:31.801569Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-07T15:03:28.460838Z","title":"Woodpecker: Hallucination correc- tion for multimodal large language models.arXiv preprint arXiv:2310.16045, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.460838Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:2e722190757f476a61ba3598a7844a6890a92bba67c876f35459f609e3f00d8d","observation_id":"5d73112b-e7f0-4497-8605-bec141936938","resolution":{"observed_at":"2026-08-07T15:03:28.460838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-07T15:03:28.536521Z","title":"Ferret: Refer and ground anything anywhere at any granularity.arXiv preprint arXiv:2310.07704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.536521Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:45722f1788af223b3f3f7ead0a542946347b26467a9e7a2655501efcbf62e29f","observation_id":"d574b11f-6bbe-47bd-af81-2752e686777e","resolution":{"observed_at":"2026-08-07T15:03:28.536521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-07T15:03:28.637634Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.637634Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:87bbb0f1acefff1c68fa3b5256d894f6e5a72adb58566f81f4a54d535fb29805","observation_id":"dc932b4e-ef19-41d7-a7cf-34d3a41dc2b5","resolution":{"observed_at":"2026-08-07T15:03:28.637634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:33.096827Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data","venue":null,"work_id":"4e8834d6-3da5-4d4e-a469-c79beaf9a7c7","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.746346Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:89bceaffd8259ef13872a4c9fce1b0ddafe4613505c39173809a669d8f4d6379","observation_id":"86c1f11b-8ab2-4d2f-9490-21f17476f577","resolution":{"observed_at":"2026-08-07T15:03:33.218471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:32.707779Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"adb5ea21-1c31-415f-961c-f8637b44816d","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.827231Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:0ee6a98637a98c04d007895e461f9138e017557c012456837e732ac372c131a1","observation_id":"b13ca783-03b5-47d8-8cd3-f51f163119d3","resolution":{"observed_at":"2026-08-07T15:03:32.917075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T15:03:28.908625Z","title":"Mm-vet: Evaluating large multimodal models for inte- grated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.908625Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:0a3a495101087cd274ba8d88b7575541832100f295226d72dacffec112204ed2","observation_id":"97ed6509-8848-445c-ac1e-cdff243fbc9c","resolution":{"observed_at":"2026-08-07T15:03:28.908625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-07-06T17:33:58.900451Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-07T15:03:29.018110Z","title":"Less is more: Mit- igating multimodal hallucination from an eos decision per- spective.arXiv preprint arXiv:2402.14545, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.018110Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:3d933e43f47772e8a10ed006dc63631e40ec0d423948f395acf97674949a14e0","observation_id":"013a8dc0-3007-41b1-beed-7273a0e9525b","resolution":{"observed_at":"2026-08-07T15:03:29.018110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01779","last_updated":"2024-03-28T22:27:12Z","snapshot_observed_at":"2026-08-07T20:31:41.793088Z","submitted_at":"2023-10-03T04:01:27Z","title":"HallE-Control: Controlling Object Hallucination in Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01779","snapshot_observed_at":"2026-08-07T15:03:29.096547Z","title":"Halle-switch: Rethinking and controlling object existence hallucinations in large vi- sion language models for detailed caption.arXiv preprint arXiv:2310.01779, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.096547Z"},"links":{"cited_paper":"/paper/2310.01779","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:21c8c4bab2d17937dc747559d0da1708420f4a7dfe2e9292e90255e53c8a04af","observation_id":"b91ed071-0510-4fa5-adf3-fe01f5281c13","resolution":{"observed_at":"2026-08-07T15:03:29.096547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-08T05:54:59.728776Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-07T15:03:29.190466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.190466Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:e3ec8f4d5467d0a66dcbbb6809bbd5e1bcbac7192526d72191c911942662b700","observation_id":"5000d8aa-ff25-4c8a-91a3-a9a6b1b2bd32","resolution":{"observed_at":"2026-08-07T15:03:29.190466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13534","last_updated":"2023-05-22T23:14:28Z","snapshot_observed_at":"2026-08-07T11:11:55.921516Z","submitted_at":"2023-05-22T23:14:28Z","title":"How Language Model Hallucinations Can Snowball","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13534","snapshot_observed_at":"2026-08-07T15:03:29.300106Z","title":"How language model hallucinations can snowball.arXiv preprint arXiv:2305.13534, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.300106Z"},"links":{"cited_paper":"/paper/2305.13534","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:873722c9cf2690feab884216c78d5247e84c7d73e83c702bfb89f9d8ec059ca0","observation_id":"c51b01a3-2ccd-4ff9-a9bf-55fd045e6954","resolution":{"observed_at":"2026-08-07T15:03:29.300106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-07T15:03:29.398340Z","title":"Internlm- xcomposer: A vision-language large model for advanced text-image comprehension and composition.arXiv preprint arXiv:2309.15112, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.398340Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:06c4f526cdd0396c7c13cb734e63a7a1e1aa87c420c48879234abcb22833cab6","observation_id":"12f0224a-b699-4faf-899f-9e6326fc8b47","resolution":{"observed_at":"2026-08-07T15:03:29.398340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T15:03:29.481580Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and out- put.arXiv preprint arXiv:2407.03320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.481580Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:590e2203322223de968eaa3d7e41cf90c0b747fe9dcd4bd5d531a0a05abbf807","observation_id":"626231af-986c-44dc-ac73-2ffb654dc266","resolution":{"observed_at":"2026-08-07T15:03:29.481580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-07T15:03:29.578054Z","title":"Siren’s song in the ai ocean: a survey on hallucination in large language models.arXiv preprint arXiv:2309.01219, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.578054Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:e8fc9b2aa53b7ce1d0b2db68d197ef646498801e62e5d91c46fd3c7d0a361302","observation_id":"f7234766-8a0d-436a-8830-fa2b8793f0d3","resolution":{"observed_at":"2026-08-07T15:03:29.578054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:32.335548Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":"dd6a2987-1f29-4f71-a35b-35856fe8165e","year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.691600Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:b583f2e9aceb071ef482f19b903006be3b3fa523e62f4244248e7d8405a0a350","observation_id":"b30317a4-5144-4870-8953-6eb0fed9b8cf","resolution":{"observed_at":"2026-08-07T15:03:32.537395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-07T15:03:29.814792Z","title":"Beyond hallucinations: En- hancing lvlms through hallucination-aware direct prefer- ence optimization.arXiv preprint arXiv:2311.16839, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.814792Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:5d48d80d1168e16aef2944d75bbd2941045789ca8e7acdca97b8741ebd9a9e60","observation_id":"40201650-cfc0-40bf-a017-9135530d8ab7","resolution":{"observed_at":"2026-08-07T15:03:29.814792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00569","last_updated":"2024-08-03T17:52:43Z","snapshot_observed_at":"2026-08-05T17:18:35.898227Z","submitted_at":"2024-06-30T03:04:11Z","title":"Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00569","snapshot_observed_at":"2026-08-07T15:03:29.916827Z","title":"Investigating and mitigating the multimodal halluci- nation snowballing in large vision-language models.arXiv preprint arXiv:2407.00569, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.916827Z"},"links":{"cited_paper":"/paper/2407.00569","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:a3d24e715623abf0dac5b7b8321557f3ca398cddce25e122004599fef1c79233","observation_id":"4d5bf860-658c-4767-b3e8-e50cce7029db","resolution":{"observed_at":"2026-08-07T15:03:29.916827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:32.037561Z","title":null,"venue":null,"work_id":"31ff88bd-b985-4ca2-a872-5e0be336a003","year":2017},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:29.995954Z"},"links":{"citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:69c4aa008f5144d3b5d5ba6c06d81b013b1e2678b46db40d5e15a7b31bd83441","observation_id":"fafaa6f1-3eab-4da1-aafc-f779f3ab0f22","resolution":{"observed_at":"2026-08-07T15:03:32.130731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-02T06:11:56.496482Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-07T15:03:30.087943Z","title":"Analyzing and mitigating object hallucination in large vision-language models.arXiv preprint arXiv:2310.00754,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:30.087943Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:b0ab27d6d9caff8d6db2f516874a53ff3fc99031aa72fcce719236d5fb21f37f","observation_id":"5864be9c-31cb-4bbe-836d-8baf52b454b7","resolution":{"observed_at":"2026-08-07T15:03:30.087943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T15:03:30.195388Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:30.195388Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:33bbff2e2203988c64c217ee16c511284536acce637459b034e96826ecd2f202","observation_id":"25fa4015-cf3d-4412-aa06-b645ba09fe3b","resolution":{"observed_at":"2026-08-07T15:03:30.195388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-07-06T17:36:56.979448Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-07T15:03:30.301678Z","title":"Ibd: Alleviating hallucinations in large vision- language models via image-biased decoding.arXiv preprint arXiv:2402.18476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:30.301678Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2505.16652"},"observation_digest":"sha256:48c738e91fac0441644a64e3e599283b5e16d63c12e02bf8563f12ad0f491e48","observation_id":"60b004da-e17e-4fea-9fcb-4baadb6f541c","resolution":{"observed_at":"2026-08-07T15:03:30.301678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16652","last_updated":"2025-06-07T18:03:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:38:06.220698Z","submitted_at":"2025-05-22T13:19:57Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":75,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 1 inbound Pith citation observation for arXiv:2505.16652."}