{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:GYDIN6CXWEQLXLJZHL5CPIGOUP","short_pith_number":"pith:GYDIN6CX","schema_version":"1.0","canonical_sha256":"360686f857b120bbad393afa27a0cea3d32f7dcbcaf268b236dcd5664162a08f","source":{"kind":"arxiv","id":"2303.01037","version":3},"attestation_state":"computed","paper":{"title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.CL","authors_text":"Andrew Rosenberg, Ankur Bapna, Bhuvana Ramabhadran, Bo Li, Chung-Cheng Chiu, Daniel S. Park, Fran\\c{c}oise Beaufays, Gary Wang, Ginger Perng, Hagen Soltau, James Qin, Jason Riesa, Johan Schalkwyk, Ke Hu, Nanxin Chen, Parisa Haghani, Pedro Moreno, Rohit Prabhavalkar, Tara Sainath, Trevor Strohman, Vera Axelrod, Wei Han, Yonghui Wu, Yongqiang Wang, Yu Zhang, Zhehuai Chen, Zhong Meng","submitted_at":"2023-03-02T07:47:18Z","abstract_excerpt":"We introduce the Universal Speech Model (USM), a single large model that performs automatic speech recognition (ASR) across 100+ languages. This is achieved by pre-training the encoder of the model on a large unlabeled multilingual dataset of 12 million (M) hours spanning over 300 languages, and fine-tuning on a smaller labeled dataset. We use multilingual pre-training with random-projection quantization and speech-text modality matching to achieve state-of-the-art performance on downstream multilingual ASR and speech-to-text translation tasks. We also demonstrate that despite using a labeled "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2303.01037","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-03-02T07:47:18Z","cross_cats_sorted":["cs.SD","eess.AS"],"title_canon_sha256":"2c318928f3d6c22a165a7fb1de2328f26102d0a4f22269d820a40c04b3b356bd","abstract_canon_sha256":"360e7295947da225857932d57e9287d80d998a3bf15e4e80e012cc1a00ccd548"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:53:35.141659Z","signature_b64":"t7pFAhU1maIeg/IrWYYDgFMTMaWdZfdLtnK7D/y/uarhCjNmMzxmzzAAZG2+BuRUSVkiBIpabqj+HOAolxS6Cw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"360686f857b120bbad393afa27a0cea3d32f7dcbcaf268b236dcd5664162a08f","last_reissued_at":"2026-07-05T06:53:35.141093Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:53:35.141093Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.CL","authors_text":"Andrew Rosenberg, Ankur Bapna, Bhuvana Ramabhadran, Bo Li, Chung-Cheng Chiu, Daniel S. Park, Fran\\c{c}oise Beaufays, Gary Wang, Ginger Perng, Hagen Soltau, James Qin, Jason Riesa, Johan Schalkwyk, Ke Hu, Nanxin Chen, Parisa Haghani, Pedro Moreno, Rohit Prabhavalkar, Tara Sainath, Trevor Strohman, Vera Axelrod, Wei Han, Yonghui Wu, Yongqiang Wang, Yu Zhang, Zhehuai Chen, Zhong Meng","submitted_at":"2023-03-02T07:47:18Z","abstract_excerpt":"We introduce the Universal Speech Model (USM), a single large model that performs automatic speech recognition (ASR) across 100+ languages. This is achieved by pre-training the encoder of the model on a large unlabeled multilingual dataset of 12 million (M) hours spanning over 300 languages, and fine-tuning on a smaller labeled dataset. We use multilingual pre-training with random-projection quantization and speech-text modality matching to achieve state-of-the-art performance on downstream multilingual ASR and speech-to-text translation tasks. We also demonstrate that despite using a labeled "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2303.01037","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2303.01037/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2303.01037","created_at":"2026-07-05T06:53:35.141154+00:00"},{"alias_kind":"arxiv_version","alias_value":"2303.01037v3","created_at":"2026-07-05T06:53:35.141154+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2303.01037","created_at":"2026-07-05T06:53:35.141154+00:00"},{"alias_kind":"pith_short_12","alias_value":"GYDIN6CXWEQL","created_at":"2026-07-05T06:53:35.141154+00:00"},{"alias_kind":"pith_short_16","alias_value":"GYDIN6CXWEQLXLJZ","created_at":"2026-07-05T06:53:35.141154+00:00"},{"alias_kind":"pith_short_8","alias_value":"GYDIN6CX","created_at":"2026-07-05T06:53:35.141154+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24169","citing_title":"Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21854","citing_title":"ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21268","citing_title":"Online Predictive Coding for Dual-Mode Self-Supervised Speech Model","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30671","citing_title":"Enhancing BEST-RQ Pseudo-Label Quality through Online Refinement for Automatic Speech Recognition","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30237","citing_title":"Comparing Human and Automatic Recognition of Dutch Dysarthric Continuous Speech: A Case Study","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27062","citing_title":"FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2312.11805","citing_title":"Gemini: A Family of Highly Capable Multimodal Models","ref_index":132,"is_internal_anchor":false},{"citing_arxiv_id":"2501.05465","citing_title":"Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)","ref_index":150,"is_internal_anchor":false},{"citing_arxiv_id":"2504.08528","citing_title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15442","citing_title":"Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2510.24570","citing_title":"BEST-RQ-Based Self-Supervised Learning for Whisper Domain Adaptation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2601.20896","citing_title":"A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2306.12925","citing_title":"AudioPaLM: A Large Language Model That Can Speak and Listen","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2410.00037","citing_title":"Moshi: a speech-text foundation model for real-time dialogue","ref_index":115,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08961","citing_title":"Dolphin-CN-Dialect: Where Chinese Dialects Matter","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08962","citing_title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2504.18425","citing_title":"Kimi-Audio Technical Report","ref_index":87,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10736","citing_title":"BlasBench: An Open Benchmark for Irish Speech Recognition","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06129","citing_title":"PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14606","citing_title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","ref_index":28,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP","json":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP.json","graph_json":"https://pith.science/api/pith-number/GYDIN6CXWEQLXLJZHL5CPIGOUP/graph.json","events_json":"https://pith.science/api/pith-number/GYDIN6CXWEQLXLJZHL5CPIGOUP/events.json","paper":"https://pith.science/paper/GYDIN6CX"},"agent_actions":{"view_html":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP","download_json":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP.json","view_paper":"https://pith.science/paper/GYDIN6CX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2303.01037&json=true","fetch_graph":"https://pith.science/api/pith-number/GYDIN6CXWEQLXLJZHL5CPIGOUP/graph.json","fetch_events":"https://pith.science/api/pith-number/GYDIN6CXWEQLXLJZHL5CPIGOUP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP/action/storage_attestation","attest_author":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP/action/author_attestation","sign_citation":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP/action/citation_signature","submit_replication":"https://pith.science/pith/GYDIN6CXWEQLXLJZHL5CPIGOUP/action/replication_record"}},"created_at":"2026-07-05T06:53:35.141154+00:00","updated_at":"2026-07-05T06:53:35.141154+00:00"}