{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:FMLSEVMDPYI6A3EHDOT6UBI3NN","short_pith_number":"pith:FMLSEVMD","schema_version":"1.0","canonical_sha256":"2b172255837e11e06c871ba7ea051b6b6fce211ac4da6f2a9e29c86b465e879c","source":{"kind":"arxiv","id":"2501.02699","version":1},"attestation_state":"computed","paper":{"title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Alvaro Soto, Andr\\'es Villa, Bernard Ghanem, Juan Le\\'on Alc\\'azar, Motasem Alfarra, Vladimir Araujo","submitted_at":"2025-01-06T00:39:31Z","abstract_excerpt":"Large language models and vision transformers have demonstrated impressive zero-shot capabilities, enabling significant transferability in downstream tasks. The fusion of these models has resulted in multi-modal architectures with enhanced instructional capabilities. Despite incorporating vast image and language pre-training, these multi-modal architectures often generate responses that deviate from the ground truth in the image data. These failure cases are known as hallucinations. Current methods for mitigating hallucinations generally focus on regularizing the language component, improving "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.02699","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-01-06T00:39:31Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"dc7b441043b00626906f930b5b8b0a6797578182b9bf4021d38817f449069a07","abstract_canon_sha256":"642625e49fddbcd12215adb19017379665b59a59438b043e79f2a641025f2dad"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:57:10.819877Z","signature_b64":"nGbEnzcwNYYnc4PwrqyqiQe+9CFu87/CwbhoVXqWan2p7u9TFjpnSdK71UvGTv29owjCNgjPlweEuCSfeD8fDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2b172255837e11e06c871ba7ea051b6b6fce211ac4da6f2a9e29c86b465e879c","last_reissued_at":"2026-07-05T09:57:10.819482Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:57:10.819482Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Alvaro Soto, Andr\\'es Villa, Bernard Ghanem, Juan Le\\'on Alc\\'azar, Motasem Alfarra, Vladimir Araujo","submitted_at":"2025-01-06T00:39:31Z","abstract_excerpt":"Large language models and vision transformers have demonstrated impressive zero-shot capabilities, enabling significant transferability in downstream tasks. The fusion of these models has resulted in multi-modal architectures with enhanced instructional capabilities. Despite incorporating vast image and language pre-training, these multi-modal architectures often generate responses that deviate from the ground truth in the image data. These failure cases are known as hallucinations. Current methods for mitigating hallucinations generally focus on regularizing the language component, improving "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.02699","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.02699/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.02699","created_at":"2026-07-05T09:57:10.819532+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.02699v1","created_at":"2026-07-05T09:57:10.819532+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.02699","created_at":"2026-07-05T09:57:10.819532+00:00"},{"alias_kind":"pith_short_12","alias_value":"FMLSEVMDPYI6","created_at":"2026-07-05T09:57:10.819532+00:00"},{"alias_kind":"pith_short_16","alias_value":"FMLSEVMDPYI6A3EH","created_at":"2026-07-05T09:57:10.819532+00:00"},{"alias_kind":"pith_short_8","alias_value":"FMLSEVMD","created_at":"2026-07-05T09:57:10.819532+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2404.18930","citing_title":"Hallucination of Multimodal Large Language Models: A Survey","ref_index":159,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN","json":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN.json","graph_json":"https://pith.science/api/pith-number/FMLSEVMDPYI6A3EHDOT6UBI3NN/graph.json","events_json":"https://pith.science/api/pith-number/FMLSEVMDPYI6A3EHDOT6UBI3NN/events.json","paper":"https://pith.science/paper/FMLSEVMD"},"agent_actions":{"view_html":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN","download_json":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN.json","view_paper":"https://pith.science/paper/FMLSEVMD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.02699&json=true","fetch_graph":"https://pith.science/api/pith-number/FMLSEVMDPYI6A3EHDOT6UBI3NN/graph.json","fetch_events":"https://pith.science/api/pith-number/FMLSEVMDPYI6A3EHDOT6UBI3NN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN/action/storage_attestation","attest_author":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN/action/author_attestation","sign_citation":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN/action/citation_signature","submit_replication":"https://pith.science/pith/FMLSEVMDPYI6A3EHDOT6UBI3NN/action/replication_record"}},"created_at":"2026-07-05T09:57:10.819532+00:00","updated_at":"2026-07-05T09:57:10.819532+00:00"}