{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:UBEL7N3ZIJFXDF252QW2ORYISU","short_pith_number":"pith:UBEL7N3Z","schema_version":"1.0","canonical_sha256":"a048bfb779424b71975dd42da74708952c3d4f04d07879c203a2e3a75ff66e42","source":{"kind":"arxiv","id":"2402.14683","version":2},"attestation_state":"computed","paper":{"title":"Visual Hallucinations of Multi-modal Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Hongbin Liu, Minxin Guo, Neil Zhenqiang Gong, Wen Huang","submitted_at":"2024-02-22T16:40:33Z","abstract_excerpt":"Visual hallucination (VH) means that a multi-modal LLM (MLLM) imagines incorrect details about an image in visual question answering. Existing studies find VH instances only in existing image datasets, which results in biased understanding of MLLMs' performance under VH due to limited diversity of such VH instances. In this work, we propose a tool called VHTest to generate a diverse set of VH instances. Specifically, VHTest finds some initial VH instances in existing image datasets (e.g., COCO), generates a text description for each VH mode, and uses a text-to-image generative model (e.g., DAL"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.14683","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-02-22T16:40:33Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"778ac379079ebf21c1bdfc4b1d636ab237623f72e73ab3503aeb4b62b92d2acf","abstract_canon_sha256":"92c8f901cbcc96a5f79d853186ad8a30a735039f465ff98054b1738e1dae45c1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:32:37.475086Z","signature_b64":"LZtjdq3P2Osh0SlNGkqYkICTOKx2LBwxerbqFf7254JNeY9F4dreEyXHyj35bR1JpsNAe7bTA18DnnEg2yT+Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a048bfb779424b71975dd42da74708952c3d4f04d07879c203a2e3a75ff66e42","last_reissued_at":"2026-07-05T08:32:37.474602Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:32:37.474602Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Visual Hallucinations of Multi-modal Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Hongbin Liu, Minxin Guo, Neil Zhenqiang Gong, Wen Huang","submitted_at":"2024-02-22T16:40:33Z","abstract_excerpt":"Visual hallucination (VH) means that a multi-modal LLM (MLLM) imagines incorrect details about an image in visual question answering. Existing studies find VH instances only in existing image datasets, which results in biased understanding of MLLMs' performance under VH due to limited diversity of such VH instances. In this work, we propose a tool called VHTest to generate a diverse set of VH instances. Specifically, VHTest finds some initial VH instances in existing image datasets (e.g., COCO), generates a text description for each VH mode, and uses a text-to-image generative model (e.g., DAL"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.14683","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.14683/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.14683","created_at":"2026-07-05T08:32:37.474658+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.14683v2","created_at":"2026-07-05T08:32:37.474658+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.14683","created_at":"2026-07-05T08:32:37.474658+00:00"},{"alias_kind":"pith_short_12","alias_value":"UBEL7N3ZIJFX","created_at":"2026-07-05T08:32:37.474658+00:00"},{"alias_kind":"pith_short_16","alias_value":"UBEL7N3ZIJFXDF25","created_at":"2026-07-05T08:32:37.474658+00:00"},{"alias_kind":"pith_short_8","alias_value":"UBEL7N3Z","created_at":"2026-07-05T08:32:37.474658+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.04046","citing_title":"Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03713","citing_title":"Investigating Adversarial Robustness of Multi-modal Large Language Models","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30911","citing_title":"What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11559","citing_title":"When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21268","citing_title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2404.18930","citing_title":"Hallucination of Multimodal Large Language Models: A Survey","ref_index":71,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17982","citing_title":"Mitigating Multimodal Hallucination via Phase-wise Self-reward","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU","json":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU.json","graph_json":"https://pith.science/api/pith-number/UBEL7N3ZIJFXDF252QW2ORYISU/graph.json","events_json":"https://pith.science/api/pith-number/UBEL7N3ZIJFXDF252QW2ORYISU/events.json","paper":"https://pith.science/paper/UBEL7N3Z"},"agent_actions":{"view_html":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU","download_json":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU.json","view_paper":"https://pith.science/paper/UBEL7N3Z","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.14683&json=true","fetch_graph":"https://pith.science/api/pith-number/UBEL7N3ZIJFXDF252QW2ORYISU/graph.json","fetch_events":"https://pith.science/api/pith-number/UBEL7N3ZIJFXDF252QW2ORYISU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU/action/storage_attestation","attest_author":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU/action/author_attestation","sign_citation":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU/action/citation_signature","submit_replication":"https://pith.science/pith/UBEL7N3ZIJFXDF252QW2ORYISU/action/replication_record"}},"created_at":"2026-07-05T08:32:37.474658+00:00","updated_at":"2026-07-05T08:32:37.474658+00:00"}