{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:OETW6E432HWV6RIYBGV5MLYIXF","short_pith_number":"pith:OETW6E43","schema_version":"1.0","canonical_sha256":"71276f139bd1ed5f451809abd62f08b945c3977c9f17ce9df936458ebf303d8b","source":{"kind":"arxiv","id":"2506.23859","version":2},"attestation_state":"computed","paper":{"title":"Less is More: Data Curation Matters in Scaling Speech Enhancement","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD"],"primary_cat":"eess.AS","authors_text":"Anurag Kumar, Chenda Li, Kohei Saijo, Marvin Sach, Robin Scheibler, Samuele Cornell, Shinji Watanabe, Tim Fingscheidt, Wangyou Zhang, Wei Wang, Yanmin Qian, Yihui Fu, Zhaoheng Ni","submitted_at":"2025-06-30T13:55:10Z","abstract_excerpt":"The vast majority of modern speech enhancement systems rely on data-driven neural network models. Conventionally, larger datasets are presumed to yield superior model performance, an observation empirically validated across numerous tasks in other domains. However, recent studies reveal diminishing returns when scaling speech enhancement data. We focus on a critical factor: prevalent quality issues in ``clean'' training labels within large-scale datasets. This work re-examines this phenomenon and demonstrates that, within large-scale training sets, prioritizing high-quality training data is mo"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.23859","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"eess.AS","submitted_at":"2025-06-30T13:55:10Z","cross_cats_sorted":["cs.SD"],"title_canon_sha256":"47a9f66f7710b6402a48e14c6c951b998efcc7fc2851a797ed5ed2d09f9de38e","abstract_canon_sha256":"816d4f04f7de7a057182f68ffb9c554adff5943ecf375642813a76c3d9359dd6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:55:41.043820Z","signature_b64":"RXDJshI/+nvrzjERodhKII8QuaxPaMYkrSx+QDAg8nq4vxviVAD0XjZOtd1LsAepB9tDJuQKEatcoms/lQ67Aw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"71276f139bd1ed5f451809abd62f08b945c3977c9f17ce9df936458ebf303d8b","last_reissued_at":"2026-07-05T11:55:41.043290Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:55:41.043290Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Less is More: Data Curation Matters in Scaling Speech Enhancement","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD"],"primary_cat":"eess.AS","authors_text":"Anurag Kumar, Chenda Li, Kohei Saijo, Marvin Sach, Robin Scheibler, Samuele Cornell, Shinji Watanabe, Tim Fingscheidt, Wangyou Zhang, Wei Wang, Yanmin Qian, Yihui Fu, Zhaoheng Ni","submitted_at":"2025-06-30T13:55:10Z","abstract_excerpt":"The vast majority of modern speech enhancement systems rely on data-driven neural network models. Conventionally, larger datasets are presumed to yield superior model performance, an observation empirically validated across numerous tasks in other domains. However, recent studies reveal diminishing returns when scaling speech enhancement data. We focus on a critical factor: prevalent quality issues in ``clean'' training labels within large-scale datasets. This work re-examines this phenomenon and demonstrates that, within large-scale training sets, prioritizing high-quality training data is mo"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.23859","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.23859/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.23859","created_at":"2026-07-05T11:55:41.043358+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.23859v2","created_at":"2026-07-05T11:55:41.043358+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.23859","created_at":"2026-07-05T11:55:41.043358+00:00"},{"alias_kind":"pith_short_12","alias_value":"OETW6E432HWV","created_at":"2026-07-05T11:55:41.043358+00:00"},{"alias_kind":"pith_short_16","alias_value":"OETW6E432HWV6RIY","created_at":"2026-07-05T11:55:41.043358+00:00"},{"alias_kind":"pith_short_8","alias_value":"OETW6E43","created_at":"2026-07-05T11:55:41.043358+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.13931","citing_title":"FSD50K-Solo: Automated Curation of Single-Source Sound Events","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2603.02641","citing_title":"Rethinking Training Targets, Architectures and Data Quality for Universal Speech Enhancement","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13931","citing_title":"FSD50K-Solo: Automated Curation of Single-Source Sound Events","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08608","citing_title":"Reducing Linguistic Hallucination in LM-Based Speech Enhancement via Noise-Invariant Acoustic-Semantic Distillation","ref_index":27,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF","json":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF.json","graph_json":"https://pith.science/api/pith-number/OETW6E432HWV6RIYBGV5MLYIXF/graph.json","events_json":"https://pith.science/api/pith-number/OETW6E432HWV6RIYBGV5MLYIXF/events.json","paper":"https://pith.science/paper/OETW6E43"},"agent_actions":{"view_html":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF","download_json":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF.json","view_paper":"https://pith.science/paper/OETW6E43","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.23859&json=true","fetch_graph":"https://pith.science/api/pith-number/OETW6E432HWV6RIYBGV5MLYIXF/graph.json","fetch_events":"https://pith.science/api/pith-number/OETW6E432HWV6RIYBGV5MLYIXF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF/action/storage_attestation","attest_author":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF/action/author_attestation","sign_citation":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF/action/citation_signature","submit_replication":"https://pith.science/pith/OETW6E432HWV6RIYBGV5MLYIXF/action/replication_record"}},"created_at":"2026-07-05T11:55:41.043358+00:00","updated_at":"2026-07-05T11:55:41.043358+00:00"}