{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:AX4G7K4T3QVJCKYNEAKYA4TPBG","short_pith_number":"pith:AX4G7K4T","schema_version":"1.0","canonical_sha256":"05f86fab93dc2a912b0d201580726f09a5638e571387c55d58c67563734ba423","source":{"kind":"arxiv","id":"2505.22483","version":2},"attestation_state":"computed","paper":{"title":"A Closer Look at Multimodal Representation Collapse","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.LG","authors_text":"Abhra Chaudhuri, Anjan Dutta, Serban Georgescu, Tu Bui","submitted_at":"2025-05-28T15:31:53Z","abstract_excerpt":"We aim to develop a fundamental understanding of modality collapse, a recently observed empirical phenomenon wherein models trained for multimodal fusion tend to rely only on a subset of the modalities, ignoring the rest. We show that modality collapse happens when noisy features from one modality are entangled, via a shared set of neurons in the fusion head, with predictive features from another, effectively masking out positive contributions from the predictive features of the former modality and leading to its collapse. We further prove that cross-modal knowledge distillation implicitly dis"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.22483","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-28T15:31:53Z","cross_cats_sorted":["cs.AI","cs.CV"],"title_canon_sha256":"fdddb8b31db9ba08ffbe7d39c9765b542db47c13b1799b5f6aa5cd86cb9cbbf7","abstract_canon_sha256":"b02f20966ab559f13d99396cb70208898c13a3b52426b63c902e3834dab58080"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:54:12.267513Z","signature_b64":"U6qs6+eKSe6qQ30sLKJBUoeJWwneaOc+wPJ8aXwx8g0kWP6fTW36mk/Zs9w94Bqe9N1or7eYIBtLnZMr8INvAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"05f86fab93dc2a912b0d201580726f09a5638e571387c55d58c67563734ba423","last_reissued_at":"2026-07-05T11:54:12.267069Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:54:12.267069Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Closer Look at Multimodal Representation Collapse","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.LG","authors_text":"Abhra Chaudhuri, Anjan Dutta, Serban Georgescu, Tu Bui","submitted_at":"2025-05-28T15:31:53Z","abstract_excerpt":"We aim to develop a fundamental understanding of modality collapse, a recently observed empirical phenomenon wherein models trained for multimodal fusion tend to rely only on a subset of the modalities, ignoring the rest. We show that modality collapse happens when noisy features from one modality are entangled, via a shared set of neurons in the fusion head, with predictive features from another, effectively masking out positive contributions from the predictive features of the former modality and leading to its collapse. We further prove that cross-modal knowledge distillation implicitly dis"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.22483","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.22483/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.22483","created_at":"2026-07-05T11:54:12.267125+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.22483v2","created_at":"2026-07-05T11:54:12.267125+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.22483","created_at":"2026-07-05T11:54:12.267125+00:00"},{"alias_kind":"pith_short_12","alias_value":"AX4G7K4T3QVJ","created_at":"2026-07-05T11:54:12.267125+00:00"},{"alias_kind":"pith_short_16","alias_value":"AX4G7K4T3QVJCKYN","created_at":"2026-07-05T11:54:12.267125+00:00"},{"alias_kind":"pith_short_8","alias_value":"AX4G7K4T","created_at":"2026-07-05T11:54:12.267125+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2607.06943","citing_title":"General Incomplete Multimodal Learning via Dynamic Quality Perception","ref_index":6,"is_internal_anchor":true},{"citing_arxiv_id":"2607.06014","citing_title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","ref_index":29,"is_internal_anchor":true},{"citing_arxiv_id":"2606.17579","citing_title":"LLM Features Can Hurt GNNs: Concatenation Interference on Homophilous Graph Benchmarks","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16104","citing_title":"StateXDiff: Cell State-Contextualized Multimodal Diffusion for Single-Cell Perturbation Prediction","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2601.21670","citing_title":"Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2602.16197","citing_title":"ModalImmune: Immunity Driven Unlearning via Self Destructive Training","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02492","citing_title":"Token-Efficient Multimodal Reasoning via Image Prompt Packaging","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21326","citing_title":"MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment","ref_index":82,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG","json":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG.json","graph_json":"https://pith.science/api/pith-number/AX4G7K4T3QVJCKYNEAKYA4TPBG/graph.json","events_json":"https://pith.science/api/pith-number/AX4G7K4T3QVJCKYNEAKYA4TPBG/events.json","paper":"https://pith.science/paper/AX4G7K4T"},"agent_actions":{"view_html":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG","download_json":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG.json","view_paper":"https://pith.science/paper/AX4G7K4T","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.22483&json=true","fetch_graph":"https://pith.science/api/pith-number/AX4G7K4T3QVJCKYNEAKYA4TPBG/graph.json","fetch_events":"https://pith.science/api/pith-number/AX4G7K4T3QVJCKYNEAKYA4TPBG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG/action/storage_attestation","attest_author":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG/action/author_attestation","sign_citation":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG/action/citation_signature","submit_replication":"https://pith.science/pith/AX4G7K4T3QVJCKYNEAKYA4TPBG/action/replication_record"}},"created_at":"2026-07-05T11:54:12.267125+00:00","updated_at":"2026-07-05T11:54:12.267125+00:00"}