{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:ARRT5BU2VRNCZDGBHEXGNSX3AU","short_pith_number":"pith:ARRT5BU2","schema_version":"1.0","canonical_sha256":"04633e869aac5a2c8cc1392e66cafb051184c9215ed62ee053c7d13ff9d10411","source":{"kind":"arxiv","id":"2608.09288","version":1},"attestation_state":"computed","paper":{"title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.SD","authors_text":"Haitao Qian, Qianxiao Fang, Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo","submitted_at":"2026-08-10T08:41:28Z","abstract_excerpt":"Audio-visual speech enhancement under real-world conditions remains challenging due to unreliable visual inputs and the lack of large-scale training data with realistic acoustic conditions. Existing approaches usually fuse visual features directly into the separation network, making them vulnerable to degraded visual signals. In this paper, we present DAVE, a decoupled audio-visual enhancement framework for real-world speech separation. Firstly, to address the data scarcity issue, we construct DAVE-Corpus, a large-scale training corpus with 219,411 mixtures generated from public meeting corpor"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2608.09288","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SD","submitted_at":"2026-08-10T08:41:28Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"f345c1857c533673ee44f8d6dfe4ed6c65878173ae0fafb41fcac92391e67674","abstract_canon_sha256":"004bb393411681907654bd7e87ec4be13e8cc63017a5d9b4484ba74270f08fab"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-11T02:22:15.945042Z","signature_b64":"Hn+JBkqX3rRb7S0btEOOcT0F/gOJWzqecozebGaeOK0XAbzWkyYCfOOR67C202ekE888kcUs8bxnKj2vTHktDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"04633e869aac5a2c8cc1392e66cafb051184c9215ed62ee053c7d13ff9d10411","last_reissued_at":"2026-08-11T02:22:15.943405Z","signature_status":"signed_v1","first_computed_at":"2026-08-11T02:22:15.943405Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.SD","authors_text":"Haitao Qian, Qianxiao Fang, Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo","submitted_at":"2026-08-10T08:41:28Z","abstract_excerpt":"Audio-visual speech enhancement under real-world conditions remains challenging due to unreliable visual inputs and the lack of large-scale training data with realistic acoustic conditions. Existing approaches usually fuse visual features directly into the separation network, making them vulnerable to degraded visual signals. In this paper, we present DAVE, a decoupled audio-visual enhancement framework for real-world speech separation. Firstly, to address the data scarcity issue, we construct DAVE-Corpus, a large-scale training corpus with 219,411 mixtures generated from public meeting corpor"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2608.09288","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2608.09288/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2608.09288","created_at":"2026-08-11T02:22:15.944075+00:00"},{"alias_kind":"arxiv_version","alias_value":"2608.09288v1","created_at":"2026-08-11T02:22:15.944075+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2608.09288","created_at":"2026-08-11T02:22:15.944075+00:00"},{"alias_kind":"pith_short_12","alias_value":"ARRT5BU2VRNC","created_at":"2026-08-11T02:22:15.944075+00:00"},{"alias_kind":"pith_short_16","alias_value":"ARRT5BU2VRNCZDGB","created_at":"2026-08-11T02:22:15.944075+00:00"},{"alias_kind":"pith_short_8","alias_value":"ARRT5BU2","created_at":"2026-08-11T02:22:15.944075+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2608.09288","citing_title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","ref_index":2,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU","json":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU.json","graph_json":"https://pith.science/api/pith-number/ARRT5BU2VRNCZDGBHEXGNSX3AU/graph.json","events_json":"https://pith.science/api/pith-number/ARRT5BU2VRNCZDGBHEXGNSX3AU/events.json","paper":"https://pith.science/paper/ARRT5BU2"},"agent_actions":{"view_html":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU","download_json":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU.json","view_paper":"https://pith.science/paper/ARRT5BU2","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2608.09288&json=true","fetch_graph":"https://pith.science/api/pith-number/ARRT5BU2VRNCZDGBHEXGNSX3AU/graph.json","fetch_events":"https://pith.science/api/pith-number/ARRT5BU2VRNCZDGBHEXGNSX3AU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU/action/storage_attestation","attest_author":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU/action/author_attestation","sign_citation":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU/action/citation_signature","submit_replication":"https://pith.science/pith/ARRT5BU2VRNCZDGBHEXGNSX3AU/action/replication_record"}},"created_at":"2026-08-11T02:22:15.944075+00:00","updated_at":"2026-08-11T02:22:15.944075+00:00"}