{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:VBYH3THJDLFVKAXZVC53QFJH2T","short_pith_number":"pith:VBYH3THJ","schema_version":"1.0","canonical_sha256":"a8707dcce91acb5502f9a8bbb81527d4d2d59b047479ae1253b47e84c2ff83c7","source":{"kind":"arxiv","id":"2412.02104","version":1},"attestation_state":"computed","paper":{"title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chen Qian, Dongrui Liu, Hui Xiong, Jiahao Huo, Jie Zhang, Jing Shao, Kaichen Huang, Kun Wang, Mengxi Gao, Sirui Huang, Xuming Hu, Yibo Yan, Yong Liu, Yunkai Dang","submitted_at":"2024-12-03T02:54:31Z","abstract_excerpt":"The rapid development of Artificial Intelligence (AI) has revolutionized numerous fields, with large language models (LLMs) and computer vision (CV) systems driving advancements in natural language understanding and visual processing, respectively. The convergence of these technologies has catalyzed the rise of multimodal AI, enabling richer, cross-modal understanding that spans text, vision, audio, and video modalities. Multimodal large language models (MLLMs), in particular, have emerged as a powerful framework, demonstrating impressive capabilities in tasks like image-text generation, visua"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.02104","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-12-03T02:54:31Z","cross_cats_sorted":[],"title_canon_sha256":"6f44ad61054ea5f23bd45245230649321ac0b8dd697467cea8cd6555dffcb3ff","abstract_canon_sha256":"dd181815c623ff0f0aaedecb81964b93f5df6c9d8944956fa8b5cc26dff6c72b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:43:44.065932Z","signature_b64":"kdi0lVvu7/DC6sPDNOIf4WcaE9/eWW9LQl1PVBR04xl2ULrahFg44JN86MBk0Vma/qOYrb3Q5G+1mJVGmTrJBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a8707dcce91acb5502f9a8bbb81527d4d2d59b047479ae1253b47e84c2ff83c7","last_reissued_at":"2026-07-05T09:43:44.065414Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:43:44.065414Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chen Qian, Dongrui Liu, Hui Xiong, Jiahao Huo, Jie Zhang, Jing Shao, Kaichen Huang, Kun Wang, Mengxi Gao, Sirui Huang, Xuming Hu, Yibo Yan, Yong Liu, Yunkai Dang","submitted_at":"2024-12-03T02:54:31Z","abstract_excerpt":"The rapid development of Artificial Intelligence (AI) has revolutionized numerous fields, with large language models (LLMs) and computer vision (CV) systems driving advancements in natural language understanding and visual processing, respectively. The convergence of these technologies has catalyzed the rise of multimodal AI, enabling richer, cross-modal understanding that spans text, vision, audio, and video modalities. Multimodal large language models (MLLMs), in particular, have emerged as a powerful framework, demonstrating impressive capabilities in tasks like image-text generation, visua"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.02104","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.02104/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.02104","created_at":"2026-07-05T09:43:44.065474+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.02104v1","created_at":"2026-07-05T09:43:44.065474+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.02104","created_at":"2026-07-05T09:43:44.065474+00:00"},{"alias_kind":"pith_short_12","alias_value":"VBYH3THJDLFV","created_at":"2026-07-05T09:43:44.065474+00:00"},{"alias_kind":"pith_short_16","alias_value":"VBYH3THJDLFVKAXZ","created_at":"2026-07-05T09:43:44.065474+00:00"},{"alias_kind":"pith_short_8","alias_value":"VBYH3THJ","created_at":"2026-07-05T09:43:44.065474+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11446","citing_title":"3D-CBM: A Framework for Concept-Based Interpretability in Generative 3D Modeling","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2502.02871","citing_title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2603.11689","citing_title":"Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2602.24176","citing_title":"Beyond Explainable AI (XAI): An Overdue Paradigm Shift and Post-XAI Research Directions","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19083","citing_title":"ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety","ref_index":129,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13565","citing_title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17941","citing_title":"From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models","ref_index":74,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T","json":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T.json","graph_json":"https://pith.science/api/pith-number/VBYH3THJDLFVKAXZVC53QFJH2T/graph.json","events_json":"https://pith.science/api/pith-number/VBYH3THJDLFVKAXZVC53QFJH2T/events.json","paper":"https://pith.science/paper/VBYH3THJ"},"agent_actions":{"view_html":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T","download_json":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T.json","view_paper":"https://pith.science/paper/VBYH3THJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.02104&json=true","fetch_graph":"https://pith.science/api/pith-number/VBYH3THJDLFVKAXZVC53QFJH2T/graph.json","fetch_events":"https://pith.science/api/pith-number/VBYH3THJDLFVKAXZVC53QFJH2T/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T/action/storage_attestation","attest_author":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T/action/author_attestation","sign_citation":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T/action/citation_signature","submit_replication":"https://pith.science/pith/VBYH3THJDLFVKAXZVC53QFJH2T/action/replication_record"}},"created_at":"2026-07-05T09:43:44.065474+00:00","updated_at":"2026-07-05T09:43:44.065474+00:00"}