{"as_of":"2026-08-07T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e15194dcb40efe0537da198ef342f93765f2c4a2c2485dcdad99125a1f954f8","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:41.573398Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19498/citation-record","integrity":"/paper/2505.19498/integrity","json":"/paper/2505.19498/citation-record.json","paper":"/paper/2505.19498"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:18:34.245378Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.245378Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:4516288355d956ec339dd8ad676ba38f3ecdf6ba0cdd826ef62bd90c21c87b1e","observation_id":"dc270e6b-1411-400f-89ab-9b53f6f0d004","resolution":{"observed_at":"2026-08-07T14:18:34.245378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T14:18:34.382282Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.382282Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:a03d32556200b6bf60770957fd3061cdf1f7f06e999c9735fe28bac3270a6718","observation_id":"e16b32d5-3e7b-4711-95fc-a16660d8f7ff","resolution":{"observed_at":"2026-08-07T14:18:34.382282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:18:34.488464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.488464Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:a3b7e1b65537161dc762fd69667a410a5800c24c2e3fe2bfa437f1c9d4e5fe60","observation_id":"079fbe18-00ed-4260-9f94-42331fa2bf94","resolution":{"observed_at":"2026-08-07T14:18:34.488464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.783621Z","title":"Grounding everything: Emerging localiza- tion properties in vision-language transformers","venue":null,"work_id":"677002e6-c564-4700-b3b7-f9f8aa4d748b","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.559262Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2194d7994a5f3927c82ffb9237769e2b04aa479a60b5d787ac8b73db42f15965","observation_id":"a0f77696-68c1-46ad-8bf6-664d8bf419c4","resolution":{"observed_at":"2026-08-07T14:18:46.882005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.485656Z","title":"Evaluating a large language model on searching for gui layouts.Proceedings of the ACM on Human-Computer Interaction, 7(EICS):1–37, 2023","venue":null,"work_id":"0a248453-de62-4718-a983-641aa0dd51cd","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.663382Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:a7e12eb10ce26845af08c8a1cde01f83e4b8d78268581e67c3098c8739ccbf89","observation_id":"0a1960cd-3116-4762-ba08-3a0cd9bfd393","resolution":{"observed_at":"2026-08-07T14:18:46.616784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:34.757066Z","title":"Lan- guage models are few-shot learners.Advances in neural in- formation processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.757066Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:670c687279c61be158b50da3dc6eb3e3018ae5c163345804ac1e015ce265a423","observation_id":"46070d0c-e37e-4745-88da-737228c6686a","resolution":{"observed_at":"2026-08-07T14:18:34.757066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T14:18:34.892057Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.892057Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:06a6fe840a50d34b1aa38db815c59f19ad047e39d65b62ccb4a10bf8e344c734","observation_id":"5b69f746-4314-4683-be6f-53aba037e581","resolution":{"observed_at":"2026-08-07T14:18:34.892057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01548","last_updated":"2024-03-12T09:49:28Z","snapshot_observed_at":"2026-07-06T17:38:51.653737Z","submitted_at":"2024-03-03T15:53:41Z","title":"In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination Mitigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01548","snapshot_observed_at":"2026-08-07T14:18:35.034387Z","title":"In-context sharpness as alerts: An inner representation perspective for hallucination mitigation.arXiv preprint arXiv:2403.01548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.034387Z"},"links":{"cited_paper":"/paper/2403.01548","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2367b6254c9b33b71dc7e9a6bcb5ebc55ab1a88611da53edc49e2ee78de9d029","observation_id":"961ad80d-293a-44e4-8a39-0d432ccb3e2c","resolution":{"observed_at":"2026-08-07T14:18:35.034387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.216299Z","title":"Palm: Scaling language modeling with pathways.Journal of Machine Learning Research, 24(240):1–113, 2023","venue":null,"work_id":"c20084c8-e37d-44f4-9254-e2ea999f4c98","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.106132Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:95c95d71909690a0435a015c9c351f8afbfbc9d4d65562fcb771fe74324b18cb","observation_id":"e49fb8e4-fbaa-47e5-8d17-208c0bae6518","resolution":{"observed_at":"2026-08-07T14:18:46.325338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-08-07T14:18:35.174567Z","title":"Dola: Decoding by con- trasting layers improves factuality in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.174567Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:8a6cf05510dc86e8e8d5ada9fcb5d86295d393627a6529e7922f8c02e64b0404","observation_id":"78c35447-c8c8-4279-84f3-d10040e6ade7","resolution":{"observed_at":"2026-08-07T14:18:35.174567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.928533Z","title":"A survey on multimodal large lan- guage models for autonomous driving","venue":null,"work_id":"5d49ef7c-3216-480a-9ad9-011a1fa46a61","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.275408Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:0cfa367c367efd091f85257cec7e8c64637ab01e399e16d6d2bae52c6700a9cb","observation_id":"13a97e78-3cda-4907-89c5-726b66c2a0a2","resolution":{"observed_at":"2026-08-07T14:18:46.069525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01983","last_updated":"2024-07-02T06:41:39Z","snapshot_observed_at":"2026-07-30T14:35:47.484748Z","submitted_at":"2024-07-02T06:41:39Z","title":"SADL: An Effective In-Context Learning Method for Compositional Visual QA","version":1},"cited_work":{"arxiv_id":"2407.01983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01983","snapshot_observed_at":"2026-08-07T14:18:42.210330Z","title":"SADL: An Effective In-Context Learning Method for Compositional Visual QA","venue":"cs.CV","work_id":"0677bc5e-bfc3-4bce-b0c0-e81e7d98b2ee","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.400317Z"},"links":{"cited_paper":"/paper/2407.01983","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:e88bc05a2ae1c553e3e58cf3cc752063601adc4ac3a0ec0debcd8d108165a1db","observation_id":"32cefc74-1e4c-497f-be3f-85dde206a9b1","resolution":{"observed_at":"2026-08-07T14:18:42.326741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T14:18:35.528263Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.528263Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:852514f2f528be96d014ce0fc9ec4312004158824eceeefaaf957f98a3effb5b","observation_id":"9926fc8f-9672-4a0a-83c8-5015e96e5818","resolution":{"observed_at":"2026-08-07T14:18:35.528263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.687518Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks.Proceedings of the National Academy of Sciences, 120(30):e2305016120, 2023","venue":null,"work_id":"b8c42786-fe2b-447e-899c-2b8d56f1c712","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.635936Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:07c5feff4f2d709a14e450a521872e1a8ba614fbca19eccc10cb321b2b45ccb0","observation_id":"f114d59b-79f9-468e-b88c-805afc2873fe","resolution":{"observed_at":"2026-08-07T14:18:45.809696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.424399Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"46b62e11-b1a2-45f7-9628-a587db3fa240","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.765639Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:388a4d58fda0c57358a50a157b64bfa4542f9c3c6c2268cb88257cd5fe7979fb","observation_id":"b21a7905-088d-4403-bd70-a8c730e38936","resolution":{"observed_at":"2026-08-07T14:18:45.537969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.092486Z","title":"A comprehensive survey of deep learn- ing for image captioning.ACM Computing Surveys (CsUR), 51(6):1–36, 2019","venue":null,"work_id":"62b22be2-986d-432e-8db6-b52923eb4f65","year":2019},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.872329Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2ce46ec01cabbe4c04a918319021b2ddc78fadf73ae398900fad44f6c8f78d38","observation_id":"ff67bef2-f80c-4967-85dc-e5019a4c77a5","resolution":{"observed_at":"2026-08-07T14:18:45.264134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04920","last_updated":"2023-04-11T01:17:11Z","snapshot_observed_at":"2026-07-06T15:14:13.670044Z","submitted_at":"2023-04-11T01:17:11Z","title":"Advancing Medical Imaging with Language Models: A Journey from N-grams to ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04920","snapshot_observed_at":"2026-08-07T14:18:35.982612Z","title":"Advancing medical imaging with language mod- els: A journey from n-grams to chatgpt.arXiv preprint arXiv:2304.04920, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.982612Z"},"links":{"cited_paper":"/paper/2304.04920","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:07e4870badecfafeba0ee82a96f9ebe65bd8319b8320fd49dc82612483d5b8b1","observation_id":"9881e557-33df-4395-a2b0-ffb5bfd6efa9","resolution":{"observed_at":"2026-08-07T14:18:35.982612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.857568Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"626da12f-54e7-497f-86ed-e51f0c09358f","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.149903Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:50f5f013c155fa1b6a97390cbdd140948e60e82a82e85779a31ca6a4ccabbff5","observation_id":"c627c9d7-cc1b-4f45-8b2d-cd7c1ed60648","resolution":{"observed_at":"2026-08-07T14:18:44.945636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.630365Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"989ea898-cdc9-4146-963a-c949f264338c","year":2019},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.382436Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:9d956679b28f76f1843b4eeca7d9d64fd8388c010457eed4f58b823a0344049b","observation_id":"0f48cfdb-27ee-4522-997d-c56fd9557b5c","resolution":{"observed_at":"2026-08-07T14:18:44.743928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-06T05:55:18.425562Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-07T14:18:36.503540Z","title":"Self-introspective de- coding: Alleviating hallucinations for large vision-language models.arXiv preprint arXiv:2408.02032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.503540Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:3214a10dd26dda69d3bd27bf43b512fbb8aaf048eead79fd23a95bb689a8d84c","observation_id":"de4fc015-8fd4-401e-be1b-5ab70560631c","resolution":{"observed_at":"2026-08-07T14:18:36.503540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:36.671574Z","title":"Survey of hallucination in natural language generation.ACM computing surveys, 55(12):1–38, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.671574Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2629e172578b234a919a236e87608d819a1fa4dd6478269cb9a59862d9cfa66f","observation_id":"7b122b0f-7388-4b0f-8273-825b5c7e9fbe","resolution":{"observed_at":"2026-08-07T14:18:36.671574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.372439Z","title":"Mitigating object hal- lucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"0313da43-c161-42d7-85df-7865f8a3999b","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.847427Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:d18bf520a3dad8183e40b1e65b6fa23e6a1124830d25cd58c01f798ed3d50fd1","observation_id":"ac0ec77b-7f88-42fe-ba60-129f0d97725d","resolution":{"observed_at":"2026-08-07T14:18:44.477176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15097","last_updated":"2023-07-10T06:08:55Z","snapshot_observed_at":"2026-07-06T14:10:59.567758Z","submitted_at":"2022-10-27T00:58:21Z","title":"Contrastive Decoding: Open-ended Text Generation as Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15097","snapshot_observed_at":"2026-08-07T14:18:37.002385Z","title":"Contrastive decoding: Open-ended text gen- eration as optimization.arXiv preprint arXiv:2210.15097,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.002385Z"},"links":{"cited_paper":"/paper/2210.15097","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:c935ffceb3ea08ee8d89aaece463337cec7477e3e4836ee07b45db61704238f8","observation_id":"8fb4c05c-aad5-4269-bf03-3a6bb44e59eb","resolution":{"observed_at":"2026-08-07T14:18:37.002385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.131762Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks.arXiv e-prints, pages arXiv–2304, 2023","venue":null,"work_id":"db6b56fe-e632-4208-a703-e09a104d2f18","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.112543Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:78c59b1d6c05bbb9bfbd44259d24f12b6f20a6cebe8547e152ee110e8f573865","observation_id":"6056d74f-aeb4-4c4b-9880-abbccfb11d05","resolution":{"observed_at":"2026-08-07T14:18:44.249543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T14:18:37.259357Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.259357Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:dd7976b2955f2a099de9fcfe539663a05663ebef823b5906f9bc6cb209f3f0b4","observation_id":"698de6d0-4453-4026-8f79-5ae428ea9567","resolution":{"observed_at":"2026-08-07T14:18:37.259357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.936221Z","title":"A survey of multimodel large language models","venue":null,"work_id":"81350637-a887-4b64-94ef-ceabf136fad6","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.405063Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2bb8dedca2cec759f20f72515bb0a288cb0cf795dd0867eda642ac7d4f54c7f3","observation_id":"4902dd3d-c455-40a0-9263-3443816fe3a8","resolution":{"observed_at":"2026-08-07T14:18:44.028181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:37.549073Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.549073Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:735dd79b292a1327699afee7c9919b0d7e6b39f57f131520be69333965de8460","observation_id":"91c838c3-8ed9-4ecd-a6ac-01b8b5f84ab9","resolution":{"observed_at":"2026-08-07T14:18:37.549073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.721752Z","title":"Aligning large multi-modal model with robust instruction tuning.CoRR, 2023","venue":null,"work_id":"e49b45ef-6262-46ae-943f-a4a4f00fc641","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.677362Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:524722140c2f9ba8c7d606d9c5b875a246f6fa252868e79dd988eee64a10f788","observation_id":"d7781a78-38b7-4e9b-a9f5-f481e94ab301","resolution":{"observed_at":"2026-08-07T14:18:43.800320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-07T14:18:37.836220Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.836220Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:a9a91eb86cf20b3a2aabc38f328e1a19d4c9ca4b9e04b684a8dea78b0e07fd80","observation_id":"110de30e-dc64-4d62-9592-269f3d2449ba","resolution":{"observed_at":"2026-08-07T14:18:37.836220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-07T14:18:37.954172Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.954172Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:8c78086d845cd38e30a45a7e8df1f632585acca689c4b354c6b6ec3cc44255d9","observation_id":"4e188057-66eb-47e9-bfa5-30fd4b3b69f2","resolution":{"observed_at":"2026-08-07T14:18:37.954172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.573134Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"83a221a5-9822-41ae-86a1-bccb70643d15","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.129342Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:7279ad375bce8ad0f12cfc59a718c3c3e3184e186354a83ab5646f804754c893","observation_id":"a711fd13-8a82-4043-b4ba-07d4253993ce","resolution":{"observed_at":"2026-08-07T14:18:43.643823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:38.252873Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.252873Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:8e874b089b88c6a7d2d90a21ac426672c216c18f802dc59b9cc8ce7fea40bc90","observation_id":"80bc08a3-7f37-4130-8c97-cd9203b4f55b","resolution":{"observed_at":"2026-08-07T14:18:38.252873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14673","last_updated":"2024-10-04T22:14:09Z","snapshot_observed_at":"2026-08-06T16:47:41.787507Z","submitted_at":"2024-06-20T18:50:44Z","title":"Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14673","snapshot_observed_at":"2026-08-07T14:18:38.394009Z","title":"Insights into llm long-context failures: When transformers know but don’t tell.arXiv preprint arXiv:2406.14673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.394009Z"},"links":{"cited_paper":"/paper/2406.14673","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:26d5d073aae58530c864b057522abd6a3713ef57dd90f02c62b3299fed937678","observation_id":"f94bb474-2d7d-4270-a942-aaf26ec30034","resolution":{"observed_at":"2026-08-07T14:18:38.394009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:38.505601Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.505601Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2c81a26da3c0d5cc003fed61ce9008f9bbcfbf0f3015f9179c90815d64441f9d","observation_id":"56dd1117-b617-4ec6-8a8e-e51e528039df","resolution":{"observed_at":"2026-08-07T14:18:38.505601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:38.667164Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.667164Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:7f8a0551432280f4cd5d63111f70db8af570daeafce484bc8786c758140c7e2b","observation_id":"3cc9d383-ae89-415a-9aba-f8c93672ea7f","resolution":{"observed_at":"2026-08-07T14:18:38.667164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T14:18:38.796832Z","title":"Object hallucination in image cap- tioning.arXiv preprint arXiv:1809.02156, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.796832Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:3ee4ab6fda7a26d3f40c700673739dabe399d23c3d3e19ba4f2bb271c69e95ec","observation_id":"d5f9ce9b-ebf9-45c7-a4af-4c68bbd6e8a2","resolution":{"observed_at":"2026-08-07T14:18:38.796832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.330762Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"efa385c7-c04b-4033-9f2b-aa92636b805c","year":2022},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.915835Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:b9f4dc1a8ff758c5cd0decff861818f08234ae7e8304ed6fb3cf9f44b5a729aa","observation_id":"999ebe78-13d1-4a2c-a2d0-c68b26805c3d","resolution":{"observed_at":"2026-08-07T14:18:43.478030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T14:18:39.047457Z","title":"Aligning large multi- modal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.047457Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:f345d2eb5dc1f66fe9a1e4fcc6dddb92521c233cb9259084eea3dca4b7d18e95","observation_id":"d01c58a5-2696-445d-ba40-1613dfdfca06","resolution":{"observed_at":"2026-08-07T14:18:39.047457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.054417Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":"95713a9c-67db-468b-9c90-4979a005c282","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.198903Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:cfb6c1b21a8f7be91756784844ca6e9d787c09287ae11f774a7c6bb095f0795a","observation_id":"ea9e165d-095d-46dc-a28b-3a0875f96296","resolution":{"observed_at":"2026-08-07T14:18:43.196522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:18:39.327647Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.327647Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:b641dd8da698227dd8dddc4d34d5eb6bdfd92f6e1725ed442b249cf830a04815","observation_id":"f82bb665-485a-4e88-94fa-ec945cfab64c","resolution":{"observed_at":"2026-08-07T14:18:39.327647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11779","last_updated":"2025-02-23T15:14:47Z","snapshot_observed_at":"2026-08-04T10:14:38.406056Z","submitted_at":"2024-10-15T16:57:44Z","title":"MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11779","snapshot_observed_at":"2026-08-07T14:18:39.471606Z","title":"Mllm can see? dynamic correction decoding for hallucination mitiga- tion.arXiv preprint arXiv:2410.11779, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.471606Z"},"links":{"cited_paper":"/paper/2410.11779","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:21e6baa388c5b1f7bf253444cc4d585af283d920245f1a3be3b7aeee877094f3","observation_id":"d284adb0-9e97-4de5-903e-d4142296ef5c","resolution":{"observed_at":"2026-08-07T14:18:39.471606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:42.812745Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":"9392d504-a3f4-44e3-85ad-bb2e6068c2a5","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.629227Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:e28838004abd4f3f96245c01ff2ac0b7af534c00bb145ab5854d9e4e006ec9f1","observation_id":"23b19e25-c978-481b-a472-cd78fdf6645e","resolution":{"observed_at":"2026-08-07T14:18:42.910544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10948","last_updated":"2025-03-16T02:23:30Z","snapshot_observed_at":"2026-08-03T12:44:11.709304Z","submitted_at":"2024-03-22T08:38:27Z","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10948","snapshot_observed_at":"2026-08-07T14:18:39.809780Z","title":"Surgical-lvlm: Learning to adapt large vision-language model for grounded visual question answering in robotic surgery.arXiv preprint arXiv:2405.10948, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.809780Z"},"links":{"cited_paper":"/paper/2405.10948","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:24721470a3b25bf9bbee85d7d2f0710381f0c1abba2d96e28186028fa86b0f6c","observation_id":"8d8cab3d-7066-47c8-a081-242256095dca","resolution":{"observed_at":"2026-08-07T14:18:39.809780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:18:39.958342Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.958342Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:f2efae6b831caaef712e92c155ed1f56486fc8baf16f6f1bf25206726763bda4","observation_id":"c5d2aac4-a924-4f4d-be0f-d31272f4e1a7","resolution":{"observed_at":"2026-08-07T14:18:39.958342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07257","last_updated":"2023-02-14T18:54:06Z","snapshot_observed_at":"2026-08-03T20:37:02.517912Z","submitted_at":"2023-02-14T18:54:06Z","title":"ChatCAD: Interactive Computer-Aided Diagnosis on Medical Image using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07257","snapshot_observed_at":"2026-08-07T14:18:40.068458Z","title":"Chatcad: Interactive computer-aided diag- nosis on medical image using large language models.arXiv preprint arXiv:2302.07257, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.068458Z"},"links":{"cited_paper":"/paper/2302.07257","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:d3b29ebd8f5a0ab39046b20a29f4e8fe3afb57d71b9b5c720a2d00c6f4c9eaa0","observation_id":"235c3cd4-3505-467a-94fe-1cedd90abd9c","resolution":{"observed_at":"2026-08-07T14:18:40.068458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-07-06T15:23:10.114682Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-07T14:18:40.218185Z","title":"Caption anything: Interactive image description with diverse multi- modal controls.arXiv preprint arXiv:2305.02677, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.218185Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:abac6580f62372b37b04050653f90b04bc4cf18e2cd5136fc298ed84fdd72845","observation_id":"59e984b1-7277-4775-aa63-e510b2a2e889","resolution":{"observed_at":"2026-08-07T14:18:40.218185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:40.379779Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for au- tonomous driving.arXiv preprint arXiv:2312.09245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.379779Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:e588e2fee2dfb27e9bcb8abadfa630232a057cf55495fc893bda42b1393f5476","observation_id":"13453da0-ec46-4982-b78a-013dd73a6d8a","resolution":{"observed_at":"2026-08-07T14:18:40.379779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18715","last_updated":"2024-06-05T13:53:42Z","snapshot_observed_at":"2026-07-06T17:52:00.714976Z","submitted_at":"2024-03-27T16:04:47Z","title":"Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18715","snapshot_observed_at":"2026-08-07T14:18:40.494427Z","title":"Mitigating hallucinations in large vision-language models with instruction contrastive decoding.arXiv preprint arXiv:2403.18715, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.494427Z"},"links":{"cited_paper":"/paper/2403.18715","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:943b889b6443705571854d3106aee11d9249321636d458bd58c8a1ec1b0452ad","observation_id":"9a54c286-d0e4-4615-9f80-2810d89316d9","resolution":{"observed_at":"2026-08-07T14:18:40.494427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:18:40.650777Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.650777Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:d7f44aa9382981f14d504265e257d23466dd9984de9687d282bf45ece59cd0e6","observation_id":"ad36b43e-9f5e-4e51-8c2c-75c1979abe93","resolution":{"observed_at":"2026-08-07T14:18:40.650777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:42.571459Z","title":"Woodpecker: Hallucination correction for multimodal large language models.Science China Information Sciences, 67(12):220105, 2024","venue":null,"work_id":"ac19c2a5-c346-4dc8-88bc-ddcce571dcda","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.775096Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:4936b3deb964db7ef5d88b91bfae370f5cbffabc18a96c1a779b41b49f6b01f5","observation_id":"17801c05-cec1-42a6-aacc-867ccdf304dd","resolution":{"observed_at":"2026-08-07T14:18:42.622977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-07-06T17:33:58.900451Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-07T14:18:40.942389Z","title":"Less is more: Mitigat- ing multimodal hallucination from an eos decision perspec- tive.arXiv preprint arXiv:2402.14545, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.942389Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:4b645aba4ce162ab63c7e64235e79ac6593abb0f9edc44af34ae172ee4b2e893","observation_id":"92015d10-50dc-43c7-a817-b1ebbaa634cb","resolution":{"observed_at":"2026-08-07T14:18:40.942389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15075","last_updated":"2023-05-24T11:56:01Z","snapshot_observed_at":"2026-08-07T23:04:52.692705Z","submitted_at":"2023-05-24T11:56:01Z","title":"HuatuoGPT, towards Taming Language Model to Be a Doctor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15075","snapshot_observed_at":"2026-08-07T14:18:41.054437Z","title":"Huatuogpt, towards taming language model to be a doctor.arXiv preprint arXiv:2305.15075, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.054437Z"},"links":{"cited_paper":"/paper/2305.15075","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2cd6dfb7a28e5df0525a86d7de94db65a9f6ecc883c21f4c833252b0e780c84e","observation_id":"0e1a60c6-4179-4a62-8d22-b860337d70a4","resolution":{"observed_at":"2026-08-07T14:18:41.054437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-07-06T16:53:51.485946Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-07T14:18:41.235492Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization.arXiv preprint arXiv:2311.16839, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.235492Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:aba4ae291f55925cf11a4049ad0a8663590835b72325d06eb8d61ee37bd60f30","observation_id":"d29c0b0d-3e93-47a7-9713-1f3b465572b9","resolution":{"observed_at":"2026-08-07T14:18:41.235492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04780","last_updated":"2025-02-18T12:47:58Z","snapshot_observed_at":"2026-08-06T15:09:11.956497Z","submitted_at":"2024-10-07T06:45:22Z","title":"Mitigating Modality Prior-Induced Hallucinations in Multimodal Large Language Models via Deciphering Attention Causality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04780","snapshot_observed_at":"2026-08-07T14:18:41.382368Z","title":"Mitigating modality prior-induced halluci- nations in multimodal large language models via deciphering attention causality.arXiv preprint arXiv:2410.04780, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.382368Z"},"links":{"cited_paper":"/paper/2410.04780","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:1ba7a25d8d380e7a14a2570b75e83daa8a8a5223de739a664d76b7d07de0fe58","observation_id":"60c69dda-7610-4e4f-99bf-92abdeafcb71","resolution":{"observed_at":"2026-08-07T14:18:41.382368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:18:41.573398Z","title":"truck” Value-Value attention Query-Key attention “bicycle","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.573398Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:ef956b4924e4c49f762711d5c863cd70c4065440576fa01711afa9e98df5767a","observation_id":"6c42e6af-2ab2-49b8-ae91-db9e666073d1","resolution":{"observed_at":"2026-08-07T14:18:41.573398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:05:25.095759Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2505.19498."}