{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:P3VZ24PISCP5NRCPAQ5OZI2VS2","short_pith_number":"pith:P3VZ24PI","schema_version":"1.0","canonical_sha256":"7eeb9d71e8909fd6c44f043aeca3559691b1f87820373adcd0e35775886ee1a1","source":{"kind":"arxiv","id":"2402.13236","version":1},"attestation_state":"computed","paper":{"title":"Towards audio language modeling -- an overview","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.SD"],"primary_cat":"eess.AS","authors_text":"Alexander H. Liu, Haibin Wu, Ho-Lam Chung, Hung-yi Lee, Kai-Wei Chang, Xuanjun Chen, Yi-Cheng Lin","submitted_at":"2024-02-20T18:50:25Z","abstract_excerpt":"Neural audio codecs are initially introduced to compress audio data into compact codes to reduce transmission latency. Researchers recently discovered the potential of codecs as suitable tokenizers for converting continuous audio into discrete codes, which can be employed to develop audio language models (LMs). Numerous high-performance neural audio codecs and codec-based LMs have been developed. The paper aims to provide a thorough and systematic overview of the neural audio codec models and codec-based LMs."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.13236","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/publicdomain/zero/1.0/","primary_cat":"eess.AS","submitted_at":"2024-02-20T18:50:25Z","cross_cats_sorted":["cs.SD"],"title_canon_sha256":"f61dd2ebf9cc3da241a068681dbfac060baa126849d3ebc414279f2b17b35510","abstract_canon_sha256":"50f30780b1ff28622a7449a0235078c3fefe791f3a38fed7e46a7d9c95203ef3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:47:22.504084Z","signature_b64":"s59ULBuQLLGxELEboi9mag6g8VayMW09V6AbHLNJPVSsYrBS3s4wxylb9fWW9KZfZWyoDY4KhAu7uzsXsauPDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7eeb9d71e8909fd6c44f043aeca3559691b1f87820373adcd0e35775886ee1a1","last_reissued_at":"2026-07-05T07:47:22.503538Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:47:22.503538Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Towards audio language modeling -- an overview","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.SD"],"primary_cat":"eess.AS","authors_text":"Alexander H. Liu, Haibin Wu, Ho-Lam Chung, Hung-yi Lee, Kai-Wei Chang, Xuanjun Chen, Yi-Cheng Lin","submitted_at":"2024-02-20T18:50:25Z","abstract_excerpt":"Neural audio codecs are initially introduced to compress audio data into compact codes to reduce transmission latency. Researchers recently discovered the potential of codecs as suitable tokenizers for converting continuous audio into discrete codes, which can be employed to develop audio language models (LMs). Numerous high-performance neural audio codecs and codec-based LMs have been developed. The paper aims to provide a thorough and systematic overview of the neural audio codec models and codec-based LMs."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.13236","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.13236/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.13236","created_at":"2026-07-05T07:47:22.503619+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.13236v1","created_at":"2026-07-05T07:47:22.503619+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.13236","created_at":"2026-07-05T07:47:22.503619+00:00"},{"alias_kind":"pith_short_12","alias_value":"P3VZ24PISCP5","created_at":"2026-07-05T07:47:22.503619+00:00"},{"alias_kind":"pith_short_16","alias_value":"P3VZ24PISCP5NRCP","created_at":"2026-07-05T07:47:22.503619+00:00"},{"alias_kind":"pith_short_8","alias_value":"P3VZ24PI","created_at":"2026-07-05T07:47:22.503619+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07494","citing_title":"Mitigating Proxy-to-Wild Domain Gap in Deepfake Speech","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01016","citing_title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06582","citing_title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11219","citing_title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","ref_index":84,"is_internal_anchor":false},{"citing_arxiv_id":"2504.08528","citing_title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2509.26388","citing_title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25591","citing_title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06582","citing_title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17435","citing_title":"MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation","ref_index":26,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2","json":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2.json","graph_json":"https://pith.science/api/pith-number/P3VZ24PISCP5NRCPAQ5OZI2VS2/graph.json","events_json":"https://pith.science/api/pith-number/P3VZ24PISCP5NRCPAQ5OZI2VS2/events.json","paper":"https://pith.science/paper/P3VZ24PI"},"agent_actions":{"view_html":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2","download_json":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2.json","view_paper":"https://pith.science/paper/P3VZ24PI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.13236&json=true","fetch_graph":"https://pith.science/api/pith-number/P3VZ24PISCP5NRCPAQ5OZI2VS2/graph.json","fetch_events":"https://pith.science/api/pith-number/P3VZ24PISCP5NRCPAQ5OZI2VS2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2/action/storage_attestation","attest_author":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2/action/author_attestation","sign_citation":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2/action/citation_signature","submit_replication":"https://pith.science/pith/P3VZ24PISCP5NRCPAQ5OZI2VS2/action/replication_record"}},"created_at":"2026-07-05T07:47:22.503619+00:00","updated_at":"2026-07-05T07:47:22.503619+00:00"}