{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:KSZWSC6I52NQ4JT5LNET6UKZJ2","short_pith_number":"pith:KSZWSC6I","schema_version":"1.0","canonical_sha256":"54b3690bc8ee9b0e267d5b493f51594e95cf035da2f5b6d5c755c5fd8ca602f2","source":{"kind":"arxiv","id":"2412.05558","version":1},"attestation_state":"computed","paper":{"title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CV","cs.MM","eess.AS"],"primary_cat":"cs.SD","authors_text":"Feng Li, Jiusong Luo, Wanjun Xia","submitted_at":"2024-12-07T06:43:39Z","abstract_excerpt":"Speech emotion recognition (SER) remains a challenging yet crucial task due to the inherent complexity and diversity of human emotions. To address this problem, researchers attempt to fuse information from other modalities via multimodal learning. However, existing multimodal fusion techniques often overlook the intricacies of cross-modal interactions, resulting in suboptimal feature representations. In this paper, we propose WavFusion, a multimodal speech emotion recognition framework that addresses critical research problems in effective multimodal fusion, heterogeneity among modalities, and"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.05558","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.SD","submitted_at":"2024-12-07T06:43:39Z","cross_cats_sorted":["cs.AI","cs.CV","cs.MM","eess.AS"],"title_canon_sha256":"6219a776ae6ed08442f622e15300ce75fbbdd58f3b9f154cc0531df912bbcd5c","abstract_canon_sha256":"5f59487b9dc2b84756f0c0fa4b1c1dc7226a68fd1c7b7baeeaf3cfe4887ee8c1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:46:05.362539Z","signature_b64":"GhlLTuZVjpOSUKH/vd2rMPRcw4VfRMAH2w7m/M/PhBbaV7cQONY9ZE69SVJiPnGUYl9eSCowe9uabcPtEkIaCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"54b3690bc8ee9b0e267d5b493f51594e95cf035da2f5b6d5c755c5fd8ca602f2","last_reissued_at":"2026-07-05T09:46:05.362082Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:46:05.362082Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CV","cs.MM","eess.AS"],"primary_cat":"cs.SD","authors_text":"Feng Li, Jiusong Luo, Wanjun Xia","submitted_at":"2024-12-07T06:43:39Z","abstract_excerpt":"Speech emotion recognition (SER) remains a challenging yet crucial task due to the inherent complexity and diversity of human emotions. To address this problem, researchers attempt to fuse information from other modalities via multimodal learning. However, existing multimodal fusion techniques often overlook the intricacies of cross-modal interactions, resulting in suboptimal feature representations. In this paper, we propose WavFusion, a multimodal speech emotion recognition framework that addresses critical research problems in effective multimodal fusion, heterogeneity among modalities, and"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.05558","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.05558/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.05558","created_at":"2026-07-05T09:46:05.362139+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.05558v1","created_at":"2026-07-05T09:46:05.362139+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.05558","created_at":"2026-07-05T09:46:05.362139+00:00"},{"alias_kind":"pith_short_12","alias_value":"KSZWSC6I52NQ","created_at":"2026-07-05T09:46:05.362139+00:00"},{"alias_kind":"pith_short_16","alias_value":"KSZWSC6I52NQ4JT5","created_at":"2026-07-05T09:46:05.362139+00:00"},{"alias_kind":"pith_short_8","alias_value":"KSZWSC6I","created_at":"2026-07-05T09:46:05.362139+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2","json":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2.json","graph_json":"https://pith.science/api/pith-number/KSZWSC6I52NQ4JT5LNET6UKZJ2/graph.json","events_json":"https://pith.science/api/pith-number/KSZWSC6I52NQ4JT5LNET6UKZJ2/events.json","paper":"https://pith.science/paper/KSZWSC6I"},"agent_actions":{"view_html":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2","download_json":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2.json","view_paper":"https://pith.science/paper/KSZWSC6I","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.05558&json=true","fetch_graph":"https://pith.science/api/pith-number/KSZWSC6I52NQ4JT5LNET6UKZJ2/graph.json","fetch_events":"https://pith.science/api/pith-number/KSZWSC6I52NQ4JT5LNET6UKZJ2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2/action/storage_attestation","attest_author":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2/action/author_attestation","sign_citation":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2/action/citation_signature","submit_replication":"https://pith.science/pith/KSZWSC6I52NQ4JT5LNET6UKZJ2/action/replication_record"}},"created_at":"2026-07-05T09:46:05.362139+00:00","updated_at":"2026-07-05T09:46:05.362139+00:00"}