{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:MZT7IWN2IIIGFH35B22JMJY75W","short_pith_number":"pith:MZT7IWN2","schema_version":"1.0","canonical_sha256":"6667f459ba4210629f7d0eb496271fedbee3d82175b47dc1b78dc76a9a44ce17","source":{"kind":"arxiv","id":"2409.06656","version":3},"attestation_state":"computed","paper":{"title":"Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG","cs.SD"],"primary_cat":"eess.AS","authors_text":"Boris Ginsburg, He Huang, Ivan Medennikov, Jagadeesh Balam, Krishna C. Puvvada, Kunal Dhawan, Nithin Rao Koluguri, Taejin Park, Weiqing Wang","submitted_at":"2024-09-10T17:20:11Z","abstract_excerpt":"Sortformer is an encoder-based speaker diarization model designed for supervising speaker tagging in speech-to-text models. Instead of relying solely on permutation invariant loss (PIL), Sortformer introduces Sort Loss to resolve the permutation problem, either independently or in tandem with PIL. In addition, we propose a streamlined multi-speaker speech-to-text architecture that leverages Sortformer for speaker supervision, embedding speaker labels into the encoder using sinusoidal kernel functions. This design addresses the speaker permutation problem through sorted objectives, effectively "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.06656","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"eess.AS","submitted_at":"2024-09-10T17:20:11Z","cross_cats_sorted":["cs.CL","cs.LG","cs.SD"],"title_canon_sha256":"9b475f10bc232536baf43771956d078041568cb8b12d05bbc786238d2ef8f873","abstract_canon_sha256":"077f332ddf10d462311afe7366cf7b17e6a09338244b5a879a33e9680db81b51"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:39:43.244863Z","signature_b64":"H+WQi3FTkrBVbG8JBlndR4tYAaCZq6IkrTApz1ICWrZBrKShPwf+Ta8hRKcQPHU4HLF53Nath+0rYmK/ym/vBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6667f459ba4210629f7d0eb496271fedbee3d82175b47dc1b78dc76a9a44ce17","last_reissued_at":"2026-07-05T11:39:43.244141Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:39:43.244141Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG","cs.SD"],"primary_cat":"eess.AS","authors_text":"Boris Ginsburg, He Huang, Ivan Medennikov, Jagadeesh Balam, Krishna C. Puvvada, Kunal Dhawan, Nithin Rao Koluguri, Taejin Park, Weiqing Wang","submitted_at":"2024-09-10T17:20:11Z","abstract_excerpt":"Sortformer is an encoder-based speaker diarization model designed for supervising speaker tagging in speech-to-text models. Instead of relying solely on permutation invariant loss (PIL), Sortformer introduces Sort Loss to resolve the permutation problem, either independently or in tandem with PIL. In addition, we propose a streamlined multi-speaker speech-to-text architecture that leverages Sortformer for speaker supervision, embedding speaker labels into the encoder using sinusoidal kernel functions. This design addresses the speaker permutation problem through sorted objectives, effectively "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.06656","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.06656/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.06656","created_at":"2026-07-05T11:39:43.244232+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.06656v3","created_at":"2026-07-05T11:39:43.244232+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.06656","created_at":"2026-07-05T11:39:43.244232+00:00"},{"alias_kind":"pith_short_12","alias_value":"MZT7IWN2IIIG","created_at":"2026-07-05T11:39:43.244232+00:00"},{"alias_kind":"pith_short_16","alias_value":"MZT7IWN2IIIGFH35","created_at":"2026-07-05T11:39:43.244232+00:00"},{"alias_kind":"pith_short_8","alias_value":"MZT7IWN2","created_at":"2026-07-05T11:39:43.244232+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11219","citing_title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","ref_index":247,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20183","citing_title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29497","citing_title":"Position-Aware Target Speaker Extraction for Long-Form Multi-Party Conversations: A Diarization-Free Framework for ASR","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28480","citing_title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20183","citing_title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","ref_index":44,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W","json":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W.json","graph_json":"https://pith.science/api/pith-number/MZT7IWN2IIIGFH35B22JMJY75W/graph.json","events_json":"https://pith.science/api/pith-number/MZT7IWN2IIIGFH35B22JMJY75W/events.json","paper":"https://pith.science/paper/MZT7IWN2"},"agent_actions":{"view_html":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W","download_json":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W.json","view_paper":"https://pith.science/paper/MZT7IWN2","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.06656&json=true","fetch_graph":"https://pith.science/api/pith-number/MZT7IWN2IIIGFH35B22JMJY75W/graph.json","fetch_events":"https://pith.science/api/pith-number/MZT7IWN2IIIGFH35B22JMJY75W/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W/action/storage_attestation","attest_author":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W/action/author_attestation","sign_citation":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W/action/citation_signature","submit_replication":"https://pith.science/pith/MZT7IWN2IIIGFH35B22JMJY75W/action/replication_record"}},"created_at":"2026-07-05T11:39:43.244232+00:00","updated_at":"2026-07-05T11:39:43.244232+00:00"}