{"as_of":"2026-08-08T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:428f75bfe191b92acc28d569d2bd64ff2dec56debabb9efd0e1dc692c2d1ca97","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":120,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":120,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":192,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:13:42.173985Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":162,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T18:32:22.813668Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2302.14045"},"observation_digest":"sha256:2178d73fbfd6ffa6f007be105bc8a029dc5ea24bc750e608b563b1d9f97d0539","observation_id":"433ab73b-0537-4db8-a9e7-f04b1b52da80","resolution":{"observed_at":"2026-05-15T18:32:22.867191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:054df158b359b038f2140ef5a43ccf7edaa6d4700f1792959d727a62d4aae89d","observation_id":"40f490d2-0806-4da5-bdb6-2be2199dab83","resolution":{"observed_at":"2026-05-16T07:07:57.904544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-05-11T10:47:44.152066Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2309.07864"},"observation_digest":"sha256:316f368630024a327335ff8b7fcf0e687626a7e183e8c74fc98bbccd822bbd5d","observation_id":"1d7b771d-c146-4787-b7af-07c3605cb699","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:7ab8d9a6790c7b0d45634d881cd7b6d6df97a5e7640a08f87e05d09be2ebf7a1","observation_id":"dfb0188f-cdd3-4cdc-9bcc-16a8bbe3cb0e","resolution":{"observed_at":"2026-05-24T00:28:39.486547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2409.18512","last_updated":"2026-04-03T15:54:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T07:46:52Z","title":"Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T20:31:24.494060Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2409.18512"},"observation_digest":"sha256:c16948ea671b1c2acf3e6122e6a6f134ccf62e5a56251060297de05570f23cc6","observation_id":"30f9dfec-c267-459c-b604-d7a7e2cf491e","resolution":{"observed_at":"2026-05-23T20:33:25.623334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-12T08:13:21.962488Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2410.00037"},"observation_digest":"sha256:5204abe6223137d0d7272816216ab99f8ba32b44cecb67d1dd35b7ca9c48f475","observation_id":"d3d8aaba-b5f2-4ace-b0de-e7e17730300a","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:15172ff65aa2402cc0e75dbaf639d19f058672b7202975556d694800aa9edd49","observation_id":"c039dc92-3020-4814-b481-32b6e0c061f7","resolution":{"observed_at":"2026-05-16T06:06:41.538849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T06:19:09.507440Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2412.10117"},"observation_digest":"sha256:7dc8e4b678e4a5733bde6a0b61a3d9801a732ed6c7b2499871366eaeb6a6f9a2","observation_id":"38eea30a-ce64-4932-b82a-c0a303b73c2d","resolution":{"observed_at":"2026-05-13T06:19:09.534650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T23:13:42.173985Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08939","last_updated":"2025-02-13T03:40:30Z","snapshot_observed_at":"2026-08-07T23:06:47.359198Z","submitted_at":"2025-02-13T03:40:30Z","title":"TokenSynth: A Token-based Neural Synthesizer for Instrument Cloning and Text-to-Instrument","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:13:42.173985Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.08939"},"observation_digest":"sha256:2235f373bc9e30ecba6c7895c45f6ffe5dca26d2bc2659ed6aa009977a1a2b3c","observation_id":"0418ca03-2808-489f-aad3-f8ec4ab9c7d3","resolution":{"observed_at":"2026-08-07T23:13:42.173985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T22:05:23.870284Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09284","last_updated":"2025-05-30T17:30:40Z","snapshot_observed_at":"2026-08-07T21:59:45.229887Z","submitted_at":"2025-02-13T12:57:15Z","title":"SparQLe: Speech Queries to Text Translation Through LLMs","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T22:05:23.870284Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.09284"},"observation_digest":"sha256:b05ea3eee5f5bdc68cf8375a16cc9aca02db6ce0998fb04a60738f688636a72a","observation_id":"a34011d6-b795-4507-aa18-cf2c0f789dc4","resolution":{"observed_at":"2026-08-07T22:05:23.870284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:25c031c37a657aecd440d809cf40b5864af23fdceadbe87a215558e65615fd19","observation_id":"6f14bc9c-e309-4a08-b023-6e708324d82e","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2505.00409","last_updated":"2026-05-17T17:39:35Z","snapshot_observed_at":"2026-07-06T21:17:28.488862Z","submitted_at":"2025-05-01T09:03:03Z","title":"Perceptual implications of automatic anonymization in pathological speech","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-22T17:58:15.380780Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.00409"},"observation_digest":"sha256:9727fe1ae9f822c29ccaacaaf8aaac32b88d76ecee254152d63c1980435a69e9","observation_id":"b02c52bd-2834-43fe-a9ad-050b94f8c7e7","resolution":{"observed_at":"2026-05-22T18:01:54.549853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:29:39.691319Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.691319Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:17d76adf1895e67b53cbbe0f7ef04c1710783f19861ee460977cf58e27aa3fd4","observation_id":"2365d3a4-9a06-480b-a9e9-738cec03d94e","resolution":{"observed_at":"2026-08-07T15:29:39.691319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:23:15.575777Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.575777Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:160f5f06c783990b6f1e58c865b00a688c79569b251d72a8a594ab6d2591c706","observation_id":"9b69b132-0295-4655-a468-effbb30fa8e2","resolution":{"observed_at":"2026-08-07T15:23:15.575777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:55:57.998249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16972","last_updated":"2025-05-22T17:51:05Z","snapshot_observed_at":"2026-08-07T14:50:02.267494Z","submitted_at":"2025-05-22T17:51:05Z","title":"From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:57.998249Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.16972"},"observation_digest":"sha256:539d7fc9541acabb07b25c973246d048320d05bc189e14ed1694b47fa59e8784","observation_id":"9dd89f1e-ac5d-4aed-99c1-9262f5d8728a","resolution":{"observed_at":"2026-08-07T14:55:57.998249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:43:04.468219Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.468219Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:96d23b2fb34fb76c745a843667fc0b8bdf0c46e4ce06909bdddd8dcc81aa97c2","observation_id":"21a846d2-cdd2-4376-9909-a4cf5715e0bd","resolution":{"observed_at":"2026-08-07T15:43:04.468219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:53:17.522496Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.522496Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:5e8563e0b8fabb5bf83f4e545fcbc0f65a9537da838a3e742f4710a3a3b1d6c3","observation_id":"f6fd71d8-af69-4bf9-956a-c795fc93f5f9","resolution":{"observed_at":"2026-08-07T14:53:17.522496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:f41fbf97c898939a4eb3fbd79d20f14f498302a621ca94fdd981b02fea88f8e5","observation_id":"82899137-acd7-40a3-82ac-e034813098ca","resolution":{"observed_at":"2026-05-16T05:27:25.468581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:33:38.473082Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18453","last_updated":"2025-05-24T01:26:02Z","snapshot_observed_at":"2026-08-07T15:24:07.535545Z","submitted_at":"2025-05-24T01:26:02Z","title":"MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:38.473082Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.18453"},"observation_digest":"sha256:aad3c68505ceaaf29a01ad6195fc3b3c921d9994ef604aec4b9e7a3c8cbf3707","observation_id":"ce6c6bcf-db0c-4678-bf67-744e62165d24","resolution":{"observed_at":"2026-08-07T14:33:38.473082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:26:03.465837Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18972","last_updated":"2025-05-25T04:43:17Z","snapshot_observed_at":"2026-08-08T00:26:18.069918Z","submitted_at":"2025-05-25T04:43:17Z","title":"Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:03.465837Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.18972"},"observation_digest":"sha256:2e8fc1d71f7b9f881d801d06204dcb7247f71b632516fdfedff62457568c3c37","observation_id":"fb98d6b6-623a-444f-9647-735442a056ad","resolution":{"observed_at":"2026-08-07T14:26:03.465837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:19:50.254673Z","title":"Neural codec language models are zero-shot text to speech synthesizers.ArXiv, abs/2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.254673Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:249c7dffae196870cf123fe17ab7a4bff4df4ae893b8471c7f769511034848ab","observation_id":"413b2487-d923-4f77-921b-443342a17858","resolution":{"observed_at":"2026-08-07T14:19:50.254673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:15:53.471613Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.471613Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:465fd8c8c502214b5d73431ce25406bbfed53bc3f06e86f08e1d6977e32191b7","observation_id":"6cc1c89c-7940-405c-8b17-9a854be9677f","resolution":{"observed_at":"2026-08-07T14:15:53.471613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:15:55.172894Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.172894Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:f0fbcc41e67042f40c09053a3ba47c3f6bbc2dd6fefd176b3d3633c96e37bf3e","observation_id":"8688be3c-dae8-4999-810d-adf59919d480","resolution":{"observed_at":"2026-08-07T14:15:55.172894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:01:32.507140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20277","last_updated":"2025-06-05T14:53:28Z","snapshot_observed_at":"2026-08-07T13:53:27.003686Z","submitted_at":"2025-05-26T17:55:06Z","title":"OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:32.507140Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.20277"},"observation_digest":"sha256:94a8eeabd67a7c8b0c8565e3e856b45d565d54bbfb6bfe8ab24948a18721c436","observation_id":"c5af4d64-86fc-478b-8394-fa81b3675b11","resolution":{"observed_at":"2026-08-07T14:01:32.507140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:00:57.267762Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20290","last_updated":"2025-06-03T22:50:28Z","snapshot_observed_at":"2026-08-07T13:53:16.201495Z","submitted_at":"2025-05-26T17:59:17Z","title":"EgoZero: Robot Learning from Smart Glasses","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:57.267762Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.20290"},"observation_digest":"sha256:39a56e0106a7983ce3935f290d5f35238119a85d3ca397081f48950eeb783d0c","observation_id":"dbc6d9d5-5c85-4d49-a7c2-adb1849501d3","resolution":{"observed_at":"2026-08-07T14:00:57.267762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T13:23:04.803829Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22054","last_updated":"2025-05-28T07:24:40Z","snapshot_observed_at":"2026-08-07T13:13:54.386349Z","submitted_at":"2025-05-28T07:24:40Z","title":"Voice Adaptation for Swiss German","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:04.803829Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.22054"},"observation_digest":"sha256:1eb248b519ee785528e3ef8ed89c7bbccf1b3127fec027d8c902e1a8c81f8093","observation_id":"07c2fa73-8827-4748-8982-68848deb21f1","resolution":{"observed_at":"2026-08-07T13:23:04.803829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:52:39.261148Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-07T21:49:28.223898Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.261148Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:04cda9b6ac2b9591a4c406d52d52d1b402407e04f6cb900c881e79b947c431ba","observation_id":"dca87ffb-0cc6-4a61-848e-5732005e753e","resolution":{"observed_at":"2026-08-07T12:52:39.261148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:45:29.146399Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23619","last_updated":"2025-05-29T16:26:32Z","snapshot_observed_at":"2026-08-07T12:39:39.469021Z","submitted_at":"2025-05-29T16:26:32Z","title":"Few-Shot Speech Deepfake Detection Adaptation with Gaussian Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:29.146399Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.23619"},"observation_digest":"sha256:d0ff2d424d4a30740834ea578a4cf27f5fd32c72aea27a87efa88cde26e02010","observation_id":"d2a7fba6-2ea3-4d24-a852-76b0406eef20","resolution":{"observed_at":"2026-08-07T12:45:29.146399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:31:37.116039Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24248","last_updated":"2025-05-30T06:12:52Z","snapshot_observed_at":"2026-08-08T04:48:33.525066Z","submitted_at":"2025-05-30T06:12:52Z","title":"Probing the Robustness Properties of Neural Speech Codecs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:31:37.116039Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.24248"},"observation_digest":"sha256:d5e853f36f22ce061464bb7975dffe4dd52f6d2f69505d8015b1ff4fd3f45158","observation_id":"0c8ee0e7-771f-415a-a6e0-7b0342511fc1","resolution":{"observed_at":"2026-08-07T12:31:37.116039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:29:39.170430Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.170430Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:facfc60f8232ed6f4d254f2675dbe3c3453d9f5c9c63800d32c7415aedb58d78","observation_id":"66668e64-fd4e-4e02-80ef-9a0e7aedb0c6","resolution":{"observed_at":"2026-08-07T12:29:39.170430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:12:56.274668Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.274668Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:009f16bf4630157b0608fef53b09310d790bec861e9a26cc8ea7653dc339c8d4","observation_id":"5eedcd3b-a9f5-4164-b969-e7bb4aaf7623","resolution":{"observed_at":"2026-08-07T12:12:56.274668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T11:57:57.777008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.777008Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:57bb983f69723c3a8b7601788a4b4a78827faab5831f5f650b0a5065d56a451d","observation_id":"f6ba4eca-b7b4-4add-aca3-978fb8275282","resolution":{"observed_at":"2026-08-07T11:57:57.777008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T11:56:29.155283Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01020","last_updated":"2025-06-01T14:04:08Z","snapshot_observed_at":"2026-08-08T01:41:10.761298Z","submitted_at":"2025-06-01T14:04:08Z","title":"DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:29.155283Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.01020"},"observation_digest":"sha256:d94ed292c701dd1e01b1124bed82174aaa26f27648b03cd7daa9685925d08941","observation_id":"7d902b6a-eab8-4e7b-bdbf-ab210c7bf1d1","resolution":{"observed_at":"2026-08-07T11:56:29.155283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T11:50:05.229980Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01322","last_updated":"2025-06-02T05:07:06Z","snapshot_observed_at":"2026-08-07T11:42:07.845517Z","submitted_at":"2025-06-02T05:07:06Z","title":"Zero-Shot Text-to-Speech for Vietnamese","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:50:05.229980Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.01322"},"observation_digest":"sha256:bd2ec7826d6059a6ab81aab1f7d38a327aba8eebb2ac51d3e4b4a6ce6b09c166","observation_id":"58e0589e-75b3-4209-915f-c8c78f31df42","resolution":{"observed_at":"2026-08-07T11:50:05.229980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T05:18:04.441044Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08346","last_updated":"2025-06-10T02:01:00Z","snapshot_observed_at":"2026-08-07T21:36:06.231728Z","submitted_at":"2025-06-10T02:01:00Z","title":"SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:04.441044Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.08346"},"observation_digest":"sha256:6c7c7e1af6b000f18bcfba0518215e1e60f3e51cb9aab66855fcab83a4a586e5","observation_id":"ee2373e2-f558-4319-8718-105285ef1601","resolution":{"observed_at":"2026-08-07T05:18:04.441044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T05:03:15.171753Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-07T20:32:05.075028Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.171753Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:ce77882db2c723dc8d187a3e88c8cd76b99dbecf04f591bf31c1bf24c24f0664","observation_id":"907f9a29-8e0a-4a27-99f6-cd12850217ed","resolution":{"observed_at":"2026-08-07T05:03:15.171753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T01:04:53.342898Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12199","last_updated":"2025-06-13T19:57:42Z","snapshot_observed_at":"2026-08-07T13:56:02.965270Z","submitted_at":"2025-06-13T19:57:42Z","title":"ViSAGe: Video-to-Spatial Audio Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:53.342898Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.12199"},"observation_digest":"sha256:506cd973d62512dc34e610671cd5ca6a41ba3799d369055d310c924cc8d7adc9","observation_id":"4705cc91-ca77-4895-aacc-1df41cdfecc3","resolution":{"observed_at":"2026-08-07T01:04:53.342898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T00:23:38.647520Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14226","last_updated":"2025-06-17T06:29:58Z","snapshot_observed_at":"2026-08-07T00:15:53.851971Z","submitted_at":"2025-06-17T06:29:58Z","title":"Investigation of Zero-shot Text-to-Speech Models for Enhancing Short-Utterance Speaker Verification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:38.647520Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.14226"},"observation_digest":"sha256:755d922a141b0bd55b53929e307dbfc7bce7e7967ccebf3909425c5f925ac02d","observation_id":"8ea03eae-a2b2-4f40-8d73-c1b3035e4ac6","resolution":{"observed_at":"2026-08-07T00:23:38.647520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T00:15:33.903012Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-07T03:22:54.643653Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.903012Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:525f75b06c141eafbf1b5e71a3e2c2d2c78161ea84e4c4bd52e22cd2b6abf5de","observation_id":"ae76af26-db9a-431e-91ec-fd57123a4bdf","resolution":{"observed_at":"2026-08-07T00:15:33.903012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T23:35:37.245740Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-07T23:23:01.221709Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.245740Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:b608ec0b16c92acaedc22204b4b7d5699465c7d9cca671b93bf34ddcf65f67eb","observation_id":"187d76d5-0bd2-4fa4-8b85-ed7273abebba","resolution":{"observed_at":"2026-08-06T23:35:37.245740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T23:11:40.868064Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.868064Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:e589f6a1d49dee035f734a5f9e78b30c40aa132de19dbb1cbe2ca7005f85ab58","observation_id":"8ef12dd1-6619-49f6-b981-784ba5565fb7","resolution":{"observed_at":"2026-08-06T23:11:40.868064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T22:11:58.112443Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.112443Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:ffbea8e8084729cea85381e5198f2e8a0470fd6b84d6620120b00c9150d5698a","observation_id":"f6314508-c797-4b3c-b0c6-6201c39e2af5","resolution":{"observed_at":"2026-08-06T22:11:58.112443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T21:51:36.176279Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-07T07:10:18.010065Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.176279Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:380aed0d12aa19ac604e68122b413f6a5c53969849df54794f51144f13476193","observation_id":"294e4a4a-e8e3-4cbd-8a99-078047d1f6d8","resolution":{"observed_at":"2026-08-06T21:51:36.176279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2506.23552","last_updated":"2026-05-15T04:47:28Z","snapshot_observed_at":"2026-07-06T21:49:33.849898Z","submitted_at":"2025-06-30T06:51:40Z","title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T00:46:39.196042Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.23552"},"observation_digest":"sha256:32a045d64b9bb3d98ccaf3c63681f00165bcdac557560b0d81da5009c0252928","observation_id":"468477d5-6558-43ad-96ea-f131f8a1a28f","resolution":{"observed_at":"2026-05-22T00:50:51.058050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T21:25:26.955694Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-08T00:25:17.722529Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.955694Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:0383f1fb7d35ed05bd3771ae6bfb3912687df0f4ad956051520e1492539e8fcc","observation_id":"1e3d7a7a-6229-458b-aee6-151703c289b9","resolution":{"observed_at":"2026-08-06T21:25:26.955694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T21:23:48.037703Z","title":"Neural codec language models are zero-shot text to speech synthesizers, 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.037703Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d1d2d0479704361c964ea7fe30773c866d0f9ca71a72b0d2c2d90819657676e1","observation_id":"013f9f70-da0e-40f7-ad16-7ecb4c6027bb","resolution":{"observed_at":"2026-08-06T21:23:48.037703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T20:06:18.853667Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03887","last_updated":"2025-07-05T03:59:17Z","snapshot_observed_at":"2026-08-07T04:02:24.838896Z","submitted_at":"2025-07-05T03:59:17Z","title":"Traceable TTS: Toward Watermark-Free TTS with Strong Traceability","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:06:18.853667Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.03887"},"observation_digest":"sha256:c8673aefdfa1875a2180ed079bcef9df30c0d87a105a75df6f1722c69df4a0f3","observation_id":"21371c99-1ebb-475b-b30e-9e9e9275736c","resolution":{"observed_at":"2026-08-06T20:06:18.853667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T18:36:07.588171Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07799","last_updated":"2025-07-10T14:26:28Z","snapshot_observed_at":"2026-08-08T00:24:15.711420Z","submitted_at":"2025-07-10T14:26:28Z","title":"SecureSpeech: Prompt-based Speaker and Content Protection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:07.588171Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.07799"},"observation_digest":"sha256:4274af6ac049701aa4df140f02b4531b9fcdcb642a36303712d06fd7c4c4f48f","observation_id":"6fda98dd-0f51-48f0-b6b5-5b3af65aeb65","resolution":{"observed_at":"2026-08-06T18:36:07.588171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T18:21:35.186108Z","title":"Neural codec language models are zero-shot text to speech synthesizers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-07T21:01:26.580728Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:35.186108Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:a6c65b5767653597db7b3c84925fd1e6b0d89695de848434432f1e4634f01ddc","observation_id":"996fba63-73dd-41c3-8edb-b77eb667202c","resolution":{"observed_at":"2026-08-06T18:21:35.186108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-02T11:31:42.381498Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T04:29:41.285194Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.09318"},"observation_digest":"sha256:3d2bbc05cb7932a4742739cdf800067211f057e4de87392f178b6028536f51a5","observation_id":"ff6179e5-4232-4fc9-b0bf-bc23e35fc95c","resolution":{"observed_at":"2026-05-19T04:32:03.689254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T17:57:51.209447Z","title":", Chen, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09618","last_updated":"2025-07-13T12:52:31Z","snapshot_observed_at":"2026-08-07T01:19:25.531425Z","submitted_at":"2025-07-13T12:52:31Z","title":"THAI Speech Emotion Recognition (THAI-SER) corpus","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T17:57:51.209447Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.09618"},"observation_digest":"sha256:a7a1a4cadd1d7fb31482d8040139f1923c96978a83f0114ac951cc36b759f761","observation_id":"05b261fb-7a24-42b5-b2b3-e3be3460c77d","resolution":{"observed_at":"2026-08-06T17:57:51.209447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T16:47:34.327894Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-07T05:00:37.140037Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.327894Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:8e2d99223a04802bba8da42cc78d8f06d9fed70e00211f0faffa254eee11bb50","observation_id":"8f4ed98d-0a48-4640-9c92-26b69045f1cb","resolution":{"observed_at":"2026-08-06T16:47:34.327894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T16:41:21.629566Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-07T10:00:05.010556Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.629566Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:77adbedc1551bdb0fb40697374195ee46f132efd60b2e01439b8bf28f373710a","observation_id":"74a3577c-1780-4876-b29a-82e23297da18","resolution":{"observed_at":"2026-08-06T16:41:21.629566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:48:20.353019Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-08T06:04:11.949761Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.353019Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c1fc989dcff23a76607585ebbe4796d563b7500f1432644411b0a36aeb1bd5b3","observation_id":"af530fdd-197d-40be-94d1-7c92f2be9d9a","resolution":{"observed_at":"2026-08-06T15:48:20.353019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:42:20.987345Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15221","last_updated":"2025-07-21T03:47:45Z","snapshot_observed_at":"2026-08-06T15:35:28.753621Z","submitted_at":"2025-07-21T03:47:45Z","title":"EchoVoices: Preserving Generational Voices and Memories for Seniors and Children","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:42:20.987345Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.15221"},"observation_digest":"sha256:43f8860ca4e46b0273e4d01003a4c5cbbd2542e2ee94a0daf34059f269c0d287","observation_id":"88e2b7df-ef30-4e6d-bbcf-ce04a4fa0eb1","resolution":{"observed_at":"2026-08-06T15:42:20.987345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:18:08.572945Z","title":"Neural codec language models are zero - shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16206","last_updated":"2025-07-22T03:42:51Z","snapshot_observed_at":"2026-08-06T15:13:08.266856Z","submitted_at":"2025-07-22T03:42:51Z","title":"METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:08.572945Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.16206"},"observation_digest":"sha256:71142a12d7f3fcfb2b5a207d1528ddcc824b62be6466c0095615ff8f7672e16e","observation_id":"39b37847-72c5-4633-94b5-1208b18484c2","resolution":{"observed_at":"2026-08-06T15:18:08.572945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:b1d38498bf051e4fd69b227e3981a06b129d9c29d651a14cca21e2a0b6a15b77","observation_id":"48038e2d-9ee6-464e-985b-d4c9e5d0aff9","resolution":{"observed_at":"2026-05-16T05:59:51.056488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:14:31.452735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.452735Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:c0926f01f74f1067ae45db75505b64eb5a49c093ce231e84fde9fe682ca7847d","observation_id":"f0760b92-4652-409b-8b16-d7a37068a120","resolution":{"observed_at":"2026-08-06T15:14:31.452735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:02:02.886470Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-07T14:59:33.170172Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.886470Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0d02622237a5352917dbcb5cef956218537e7258068a96ee61103748c9dc7753","observation_id":"d96c6f96-d5ae-4aa6-b75b-63251abf5781","resolution":{"observed_at":"2026-08-06T15:02:02.886470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T14:43:38.051881Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21150","last_updated":"2025-07-23T21:16:08Z","snapshot_observed_at":"2026-08-06T14:37:38.949103Z","submitted_at":"2025-07-23T21:16:08Z","title":"WaveVerify: A Novel Audio Watermarking Framework for Media Authentication and Combatting Deepfakes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:38.051881Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.21150"},"observation_digest":"sha256:be2cfaa4017531b720b90007e5c0d13a57a399493a787674b9994ed4a7b4f4cd","observation_id":"95961397-4013-4c3e-9679-8b35aa91fd5a","resolution":{"observed_at":"2026-08-06T14:43:38.051881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T12:49:22.407513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-07T23:23:35.413701Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:22.407513Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:c762fa7674cacf64626be5617aac4936d9fa7962b38d9601eccfa024966dc51a","observation_id":"3117c809-33dd-40cd-bb78-4f97974d5016","resolution":{"observed_at":"2026-08-06T12:49:22.407513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T11:34:09.160142Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-06T18:06:32.518742Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.160142Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:08db225693fe46bed26929f1326fccb3d54c68b11807124aeea7bca562ff982c","observation_id":"7f2d6d4c-ffdd-4fe9-8d08-605b21eeb050","resolution":{"observed_at":"2026-08-06T11:34:09.160142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T11:22:27.428195Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.428195Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:2592aa80068a9dea41ecc7a3d3b93e647de7e37a0804f1a7231d8ff02dd5e0b8","observation_id":"2e844282-1ca3-4230-b734-949e062f358f","resolution":{"observed_at":"2026-08-06T11:22:27.428195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T06:04:29.948925Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T20:34:36.422314Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.948925Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:cd107841befdfcaee40b1e54632e78b5ea87aeef4da87661e6e676ea224f9cdd","observation_id":"a8811ba4-f8e9-4233-bc25-30129c684a9b","resolution":{"observed_at":"2026-08-06T06:04:29.948925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T05:40:56.949098Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01394","last_updated":"2025-08-02T14:58:34Z","snapshot_observed_at":"2026-08-06T16:12:20.880690Z","submitted_at":"2025-08-02T14:58:34Z","title":"Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:40:56.949098Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.01394"},"observation_digest":"sha256:69877aec4f69fbbb8c10b04ffd2561290e0775ba7cc242032083a4a58a3869d5","observation_id":"51d1501e-d1f2-45d8-8ac0-7b4eb62d7830","resolution":{"observed_at":"2026-08-06T05:40:56.949098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T23:43:05.255488Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:05.255488Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:a85a21270c2b43bea1ec09ee293e424d18277f41452afcd78f8cc334db75ebff","observation_id":"5c207100-60f2-4702-b564-334988185f9a","resolution":{"observed_at":"2026-08-05T23:43:05.255488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T20:04:50.064063Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.064063Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:fbec20b64a4bad06e7209e53c1be2556f577748de6340ebaa29c727cff0b450f","observation_id":"faa15446-d0e2-479a-84e9-03b0b46f337b","resolution":{"observed_at":"2026-08-05T20:04:50.064063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T19:54:58.586186Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.586186Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:84cdd961182846e521683b29569ed1f6c1e8d781c59c0aa839106a2ed52be96b","observation_id":"7f87b3e5-0f62-484c-a2bf-6ee9e158b49b","resolution":{"observed_at":"2026-08-05T19:54:58.586186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T16:01:52.813060Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.813060Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:643a830f74ff0156f2d540c7a3416baa733e081ea0d4cab34a93f51fb14fc13c","observation_id":"e7a870c0-8ae9-4cb2-b7d2-6361397113fe","resolution":{"observed_at":"2026-08-05T16:01:52.813060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T15:00:14.073906Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-07T03:22:53.746027Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.073906Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:980edbf2279dd8c99f9781414c0fc1d215efd1f6d7bf9c1fb3e4f1a9f3c63476","observation_id":"92059eaf-e1d3-4fd6-a32d-58e5de8d0d8c","resolution":{"observed_at":"2026-08-05T15:00:14.073906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T13:35:04.280612Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00561","last_updated":"2025-08-30T17:10:22Z","snapshot_observed_at":"2026-08-08T00:31:06.181577Z","submitted_at":"2025-08-30T17:10:22Z","title":"FreeTalk:A plug-and-play and black-box defense against speech synthesis attacks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:35:04.280612Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.00561"},"observation_digest":"sha256:ed4484072fbafbedd7baff920be543d8e656b62ec9566cc39621db939f35022c","observation_id":"caa4fed2-b6f6-4b3a-bfee-25ed8bfb1ed6","resolution":{"observed_at":"2026-08-05T13:35:04.280612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T13:24:34.185099Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.185099Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:d9c08f522c276d122ed350f0bfcab88c53cd97ddda9fc21f40f12023cf579029","observation_id":"801c9947-2627-41c8-acd0-93c70e48918f","resolution":{"observed_at":"2026-08-05T13:24:34.185099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-07T01:53:38.136292Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:6937074b5e9d90396ab8435cf81b82a0ccf591aecf7623f401577198b8fa5e19","observation_id":"1d9d3ebc-8870-446b-8f2e-5308dc2057af","resolution":{"observed_at":"2026-05-21T22:24:23.489484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T10:36:01.815189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03959","last_updated":"2025-09-05T06:09:30Z","snapshot_observed_at":"2026-08-07T03:15:51.661433Z","submitted_at":"2025-09-04T07:36:43Z","title":"WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T10:36:01.815189Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.03959"},"observation_digest":"sha256:359e95bf8f0b68fcf035778d227fb639ab9c202b794a4c8264c4b15f601d343d","observation_id":"896d6676-1b94-453e-be33-5b385a527b2b","resolution":{"observed_at":"2026-08-05T10:36:01.815189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T05:51:44.533336Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04871","last_updated":"2025-09-05T07:36:12Z","snapshot_observed_at":"2026-08-05T05:51:44.046781Z","submitted_at":"2025-09-05T07:36:12Z","title":"Cloning a Conversational Voice AI Agent from Call\\,Recording Datasets for Telesales","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:51:44.533336Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.04871"},"observation_digest":"sha256:f1af06dc91bc9975fdeb225c67c2930c78dfe208876c5f071db6e9903c956e0d","observation_id":"451c10cf-ad20-40b1-81ef-1a87c8c042a6","resolution":{"observed_at":"2026-08-05T05:51:44.533336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T05:01:37.053855Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.ArXiv, 2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-07T16:55:54.177655Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:37.053855Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:8dd64c1914e518adc572d7a54937c12c5362ab7f424074aa38833909a73f827c","observation_id":"4d66cf36-f702-433f-8c07-6879722d55a0","resolution":{"observed_at":"2026-08-05T05:01:37.053855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T19:37:53.944636Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.944636Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:3ceaed2ea23b0cdfb69f0978b7ebddbb2b75f52e8e6698cc684708a0a366a205","observation_id":"f489a456-69c3-44f8-9163-9a4a535cf71a","resolution":{"observed_at":"2026-08-04T19:37:53.944636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T21:25:27.309365Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.ArXiv, 2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-06T19:09:07.884728Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.309365Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:9973015ea62cb97ff8e7e07e21aa60e7176b6e3253001c8e81d01b37988b9ad6","observation_id":"96f8f981-3f28-4c28-b8f2-5f1b8e04085a","resolution":{"observed_at":"2026-08-04T21:25:27.309365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T19:11:59.593328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09748","last_updated":"2025-09-11T12:32:08Z","snapshot_observed_at":"2026-08-06T08:55:28.245549Z","submitted_at":"2025-09-11T12:32:08Z","title":"DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T19:11:59.593328Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.09748"},"observation_digest":"sha256:b6907a47d40f70dd79ea2c1cf340dfb49c94c3765bab5cf4bc663e04a387594d","observation_id":"bb4c225b-9529-45bc-b444-56a161c55a5a","resolution":{"observed_at":"2026-08-04T19:11:59.593328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T17:10:03.685597Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11084","last_updated":"2025-09-14T04:25:13Z","snapshot_observed_at":"2026-08-07T06:47:32.964279Z","submitted_at":"2025-09-14T04:25:13Z","title":"Length-Aware Rotary Position Embedding for Text-Speech Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:10:03.685597Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.11084"},"observation_digest":"sha256:325d6e4907b3094abbb72ee3f9c6ebbec4382fde11924bbe3d542e177cfd6780","observation_id":"eb2213ca-41f2-4def-9e72-380d921a6b27","resolution":{"observed_at":"2026-08-04T17:10:03.685597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2509.11717","last_updated":"2026-06-21T14:09:38Z","snapshot_observed_at":"2026-08-04T16:48:20.030372Z","submitted_at":"2025-09-15T09:12:57Z","title":"CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T16:44:32.104114Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.11717"},"observation_digest":"sha256:1d44ccdfdabe65dec94e4f5c7872879acf938f610c1b82816c1e00d1622906cc","observation_id":"0e51b81a-7193-40de-9309-2975f587cb7b","resolution":{"observed_at":"2026-05-18T16:46:37.601457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T16:48:34.261704Z","title":"Neural codec language models are zero-shot text to speech synthesizers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11717","last_updated":"2026-06-21T14:09:38Z","snapshot_observed_at":"2026-08-04T16:48:20.030372Z","submitted_at":"2025-09-15T09:12:57Z","title":"CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents","version":6},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T16:48:34.261704Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.11717"},"observation_digest":"sha256:61eb9203ac55da504337953a3f28c89a1acd43828991c5ae8b41e6d58013076e","observation_id":"2de345b8-464a-42fa-ad68-22a579d80986","resolution":{"observed_at":"2026-08-04T16:48:34.261704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T11:29:36.075318Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.075318Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:84aa63b04aab8fdf2dd656dfbf4a41608c38cee1166a2e73e87ddf9f417b759c","observation_id":"2b3821e8-c4cb-4589-b362-5bfc4485c04c","resolution":{"observed_at":"2026-08-04T11:29:36.075318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2510.24211","last_updated":"2026-05-05T17:15:37Z","snapshot_observed_at":"2026-07-06T22:34:13.674208Z","submitted_at":"2025-10-28T09:26:27Z","title":"Speculative Coupled Decoding for Training-Free Lossless Acceleration of Autoregressive Visual Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T03:20:35.021120Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2510.24211"},"observation_digest":"sha256:f6c67fdd59cac03187ea5456046972a5d52cb3158dbe1c163e3980529cd6a130","observation_id":"a7e93bc3-2ecb-4ced-b1d1-41c14daf4228","resolution":{"observed_at":"2026-05-18T03:20:48.597426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:972e5afe322d3e42f8df3c2ef9f2918b5b12236b14d410519bb8bc6413b7cc56","observation_id":"9289ac55-4351-41a5-85b6-75094684eb58","resolution":{"observed_at":"2026-05-21T18:20:29.298575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2512.20211","last_updated":"2026-06-29T06:29:50Z","snapshot_observed_at":"2026-08-08T01:39:31.067018Z","submitted_at":"2025-12-23T10:04:48Z","title":"Aliasing-Free Neural Audio Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T20:34:50.539351Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2512.20211"},"observation_digest":"sha256:4d6bfcbd1e222ac63b116cbfaca7c5eaae021b205198bd28880738e3218cc0c3","observation_id":"401bb360-ae68-4c51-844e-693ef14f636f","resolution":{"observed_at":"2026-05-16T20:38:24.822590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-03T14:33:09.875302Z","title":"Neural Codec Language Mod- els are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20211","last_updated":"2026-06-29T06:29:50Z","snapshot_observed_at":"2026-08-08T01:39:31.067018Z","submitted_at":"2025-12-23T10:04:48Z","title":"Aliasing-Free Neural Audio Synthesis","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T14:33:09.875302Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2512.20211"},"observation_digest":"sha256:b6f2cace350afbd7d972da312a44fe380bc5721d8490b7be7712475a87e79f22","observation_id":"c0dad54a-e6e0-4ac5-b440-8a7c80231c7f","resolution":{"observed_at":"2026-08-03T14:33:09.875302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-03T11:46:12.223223Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.05329","last_updated":"2026-06-28T13:33:39Z","snapshot_observed_at":"2026-08-07T05:42:30.200481Z","submitted_at":"2026-01-08T19:16:27Z","title":"CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:46:12.223223Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2601.05329"},"observation_digest":"sha256:397e1b27b7e6ff93ae3cbe3ee673c5c82b1223d396cf4f935c64b07c22fd74f3","observation_id":"407faa63-45d7-4036-a722-81c0e57e3ba1","resolution":{"observed_at":"2026-08-03T11:46:12.223223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-03T11:31:44.746186Z","title":"InFindings of the Association for Computa- tional Linguistics: EMNLP 2022, pages 2707–2735, Abu Dhabi, United Arab Emirates","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.06329","last_updated":"2026-05-27T06:16:34Z","snapshot_observed_at":"2026-08-07T23:22:41.531750Z","submitted_at":"2026-01-09T22:01:56Z","title":"On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T11:31:44.746186Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2601.06329"},"observation_digest":"sha256:07844a9acb82efef6fca060dc8d905427aa5a62ce2b2ed295e93721260d11dc0","observation_id":"07662bee-7395-480a-923e-d7af4d78f88c","resolution":{"observed_at":"2026-08-03T11:31:44.746186Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:6675df6fc902426989164d5fd6d0d15fe75cee16713792f3630e92ed324d4b6f","observation_id":"237646c5-2a90-4e69-977e-307008aef4ea","resolution":{"observed_at":"2026-05-16T19:24:56.149288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-03T08:05:55.430857Z","title":"Neural codec language models are zero-shot text to speech synthesizers, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18537","last_updated":"2026-07-21T01:30:59Z","snapshot_observed_at":"2026-08-03T08:05:53.769721Z","submitted_at":"2026-01-26T14:42:31Z","title":"SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:05:55.430857Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2601.18537"},"observation_digest":"sha256:914afd2d5c9bb4144568874a7be3e6f25adc3d0b831b470ab28c9395133f3a7d","observation_id":"e58362e4-73da-4412-a91f-d82f8a5896f2","resolution":{"observed_at":"2026-08-03T08:05:55.430857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:5bd03cd7047450bdb76538471c74f7cd354d82a3c88969fa6274e4d35d9f8afc","observation_id":"0e3f6799-ecbc-415d-ab95-7fdd18c8b98a","resolution":{"observed_at":"2026-05-16T05:50:40.264150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-03T00:11:16.989412Z","title":"Neural codec language models are zero-shot text to speech synthesizers.arXiv preprint arXiv:2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12304","last_updated":"2026-07-23T11:24:08Z","snapshot_observed_at":"2026-08-03T00:11:08.466564Z","submitted_at":"2026-02-12T03:25:41Z","title":"OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T00:11:16.989412Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2602.12304"},"observation_digest":"sha256:288e8b600ea571ad0f8509580c27e3ac2ef6130343308556a9bfd8c956e5584f","observation_id":"cc76f225-cba5-4588-b0a1-fb50438b7dc1","resolution":{"observed_at":"2026-08-03T00:11:16.989412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-02T18:03:40.027879Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-07T13:18:57.230768Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.027879Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:1b14b5d526d5de763ab1a16da0eb0492498a0ca477590ab19e647305e5106ce8","observation_id":"0cd1e6aa-b77f-48ac-8e1a-832191215d75","resolution":{"observed_at":"2026-08-02T18:03:40.027879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2603.19798","last_updated":"2026-04-03T08:41:19Z","snapshot_observed_at":"2026-07-06T22:49:52.077931Z","submitted_at":"2026-03-20T09:37:54Z","title":"Borderless Long Speech Synthesis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T07:39:45.386208Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2603.19798"},"observation_digest":"sha256:de7a94d253c88482048205d0d9d3d8619d5a551b5ad63888fc0aa9c7e8e2948e","observation_id":"3808e4c4-f71f-4a9c-8fba-5651c4848a1c","resolution":{"observed_at":"2026-05-15T07:39:50.180256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:e4a1bda7dae3798f551e9c25bd413bc4f496ef5a4bf779ed42a56844cea24a27","observation_id":"59891d00-1594-4f9d-ba16-054ea3478155","resolution":{"observed_at":"2026-05-15T00:39:35.900889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:35645cb7c0387eaf5e7133b53ef9720ee6083bcb829a6782f8fdc112e3594a94","observation_id":"04b87d48-ae9f-4f0b-b171-95f4075104c7","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2604.08558","last_updated":"2026-06-23T07:14:55Z","snapshot_observed_at":"2026-07-13T23:53:49.367849Z","submitted_at":"2026-03-17T07:35:28Z","title":"WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T10:29:51.313835Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2604.08558"},"observation_digest":"sha256:aa97d485275ea93d865423241a133053889980faecd2ce0d69ea1d80be7183a4","observation_id":"8a133291-d5de-4349-9bcc-0ea6f55e40ce","resolution":{"observed_at":"2026-05-15T10:29:55.920449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2604.09054","last_updated":"2026-06-23T01:22:05Z","snapshot_observed_at":"2026-07-12T23:32:56.608872Z","submitted_at":"2026-04-10T07:27:55Z","title":"HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:56.766226Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2604.09054"},"observation_digest":"sha256:37fdd7691923ea22dbb9d2fa000652b7f98294b2b6e18577a6a02797336dd584","observation_id":"727feb1c-1375-4125-b8b5-28409fa22d77","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2604.10065","last_updated":"2026-04-11T07:07:08Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T07:07:08Z","title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:45.214298Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2604.10065"},"observation_digest":"sha256:10bbf0b62615870c3be95a82ee9390d17f9ca51ea494c1b1d47aad7d4e9bac0a","observation_id":"51985833-c37d-4cbb-bb7b-9174ec1da7ca","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2301.02111/citation-record","integrity":"/paper/2301.02111/integrity","json":"/paper/2301.02111/citation-record.json","paper":"/paper/2301.02111"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.09514","last_updated":"2018-06-25T15:01:54Z","snapshot_observed_at":"2026-07-06T06:46:39.730728Z","submitted_at":"2018-06-25T15:01:54Z","title":"The Emotional Voices Database: Towards Controlling the Emotion Dimension in Voice Generation Systems","version":1},"cited_work":{"arxiv_id":"1806.09514","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.09514","snapshot_observed_at":"2026-07-03T14:38:28.633204Z","title":"The Emotional Voices Database: Towards Controlling the Emotion Dimension in Voice Generation Systems","venue":"cs.CL","work_id":"f30e2dab-601f-4b23-bce0-3f345bf9a7ed","year":2018},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/1806.09514","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:09a29828a6a4cd4bee24c460aa7b1069de3dbc4146167e21f7f132da83eec257","observation_id":"f7c0ecb0-498a-49cb-aee6-2a874a793c51","resolution":{"observed_at":"2026-05-13T01:31:07.124381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"vq-wav2vec: Self-supervised learning of discrete speech representations","venue":null,"work_id":"974b1627-21a5-4214-bd57-d811b750abec","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:deb30ae0e0e1229e926c9c9f5dea4fb514faa2dc6b0cfd41998b03f9132fa3b6","observation_id":"80812234-f2aa-45cb-891f-e689a56cfbc5","resolution":{"observed_at":"2026-05-13T01:31:07.157127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-02T01:30:06.675966Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.03143","doi":"10.48550/arxiv.2209.03143","metadata_source":"arxiv_reference","pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiolm: a language modeling approach to audio generation","venue":"arXiv (Cornell University)","work_id":"3a2aea1c-8117-4436-9100-0536aea3cf47","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:e885b07a903492eae39b105fe93fc677d22589d46edfd0fb59bbc6c6573329c4","observation_id":"af1f36ac-7d3e-43cc-bfd1-c1f8d44ad6ce","resolution":{"observed_at":"2026-05-13T01:31:07.104833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the encoding layer and loss function in end- to-end speaker and language recognition system","venue":null,"work_id":"87172dc5-43ad-40c6-b5e8-90d622c31ceb","year":2018},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:1309a921bed884c3caa32ede27a9b419a78e354298146e00ebce00cf02e30d22","observation_id":"45eb912f-5447-4ecb-9411-de6ec0f23d85","resolution":{"observed_at":"2026-05-13T01:31:07.144836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:1aa19cd9834b28340fd4a8f471aa9d7b142e1467d7ed1fb8b6ddbbefcb020a95","observation_id":"dd517ae2-1536-4ed0-8e25-aff5c8c62b6f","resolution":{"observed_at":"2026-05-13T01:31:07.111554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:818a5809f70eb88487687af2e87aad5bc07fa5596ac787a695f348a534454656","observation_id":"b4cc583d-a536-46ed-92e7-5eaa696a5e18","resolution":{"observed_at":"2026-05-13T21:49:52.306785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VQTTS: high-ﬁdelity text-to-speech synthesis with self-supervised VQ acoustic feature","venue":null,"work_id":"2764cec9-eabb-428e-9667-5310ce49a353","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:48834c4c78b4c12aeb381eb5888b8c4886a6ac5f5c4fc1403c258ef23f197134","observation_id":"05b2c44b-6903-4fa1-a6c2-0401405e2abf","resolution":{"observed_at":"2026-05-13T01:31:07.166080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-489","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia, Ruslan Salakhutdinov, and Abdelrahman Mohamed","venue":"Interspeech 2022","work_id":"3b4a6c8f-f8e9-40ae-84f3-0c06d4f85b2e","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:0e500b6fce3b59895225cf8487791036baabc52962c8554192c1b369486898f3","observation_id":"a7d60a69-6490-4353-8369-a7c041d0eb88","resolution":{"observed_at":"2026-05-13T01:31:07.078073Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09383","last_updated":"2023-03-14T02:42:07Z","snapshot_observed_at":"2026-07-06T14:19:39.156008Z","submitted_at":"2022-11-17T07:17:24Z","title":"Grad-StyleSpeech: Any-speaker Adaptive Text-to-Speech Synthesis with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.09383","doi":"10.48550/arxiv.2211.09383","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Any-speaker adaptive text-to-speech synthesis with diffusion models","venue":"arXiv (Cornell University)","work_id":"c4ded83c-cf06-4fd1-82be-d0f76c6b4ec0","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/2211.09383","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:dd51476aff71f29770d650261b16ab2c61e6d3e3ba37800ecfc2cdc14505e576","observation_id":"d4789d3f-ed65-4a47-a9ea-7b36800571cb","resolution":{"observed_at":"2026-05-13T01:31:07.090934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09383","last_updated":"2023-03-14T02:42:07Z","snapshot_observed_at":"2026-07-06T14:19:39.156008Z","submitted_at":"2022-11-17T07:17:24Z","title":"Grad-StyleSpeech: Any-speaker Adaptive Text-to-Speech Synthesis with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.09383","doi":"10.48550/arxiv.2211.09383","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Any-speaker adaptive text-to-speech synthesis with diffusion models","venue":"arXiv (Cornell University)","work_id":"c4ded83c-cf06-4fd1-82be-d0f76c6b4ec0","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/2211.09383","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:65e01a7fd3d8c3338e4e52a9d07dc77b4c92583d73bddfab96bd1112acdf2553","observation_id":"8854bd9f-f7e2-4f53-b779-cd40cc3f72a9","resolution":{"observed_at":"2026-05-13T01:31:07.069766Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01192","last_updated":"2021-09-09T22:36:33Z","snapshot_observed_at":"2026-07-06T10:37:37.039377Z","submitted_at":"2021-02-01T21:41:40Z","title":"Generative Spoken Language Modeling from Raw Audio","version":2},"cited_work":{"arxiv_id":"2102.01192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.01192","snapshot_observed_at":"2026-07-04T03:49:30.225955Z","title":"Generative spoken language modeling from raw audio","venue":null,"work_id":"6d9290f7-6174-49b3-bb17-eb6bc996ff9c","year":2021},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/2102.01192","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:1dae429294ba2007cf9325979af8004fea6f90a7d028c18f9a5b6016f7ae505f","observation_id":"a3fe5a0c-314d-47f0-b0b5-7f48da80f4f5","resolution":{"observed_at":"2026-05-13T01:31:07.097756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained emotion strength transfer, control and prediction for emotional speech synthesis","venue":null,"work_id":"7b57aa03-228c-47dd-8d85-d5fe845cf2ed","year":2021},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:475a1fb067df9229e53f77428206f8caa66b75cd2edd9ae22289adac963be799","observation_id":"84a685ac-af08-4e4c-887d-d0f151fabf4f","resolution":{"observed_at":"2026-05-13T01:31:07.134672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delightfultts 2: End-to-end speech synthesis with adversarial vector-quantized auto-encoders","venue":null,"work_id":"d7181af4-50de-465a-9183-1c511560f325","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:c50058ee58f5638011a8a7a733de3de01e2ec8adf7392a8530ef02eff5637e0b","observation_id":"a0dabbab-7521-47fb-9a03-82a0063582f2","resolution":{"observed_at":"2026-05-13T01:31:07.139596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:2e1d2e726177a4bab9c8c056308a67487be901750733ff11cfe1a49087316c06","observation_id":"ac8ae89d-8bba-41b4-af8b-0fe342fc279d","resolution":{"observed_at":"2026-05-13T01:31:07.062215Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b5c2116a-05d2-48ef-a6b6-50d88eb025b7","year":2021},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:0c80660e254c77d6a43174010dbef3dd65d64042cfb79ba58e76b90ce99f2909","observation_id":"451abf9c-4dac-461d-81da-1bc68489f169","resolution":{"observed_at":"2026-05-13T01:31:07.148938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Daniel Povey, Arnab Ghoshal, Gilles Boulianne, Lukas Burget, Ondrej Glembek, Nagendra Goel, Mirko Hannemann, Petr Motlicek, Yanmin Qian, Petr Schwarz, et al","venue":null,"work_id":"1c719871-90c5-47b1-a862-d3fd0e06fc3d","year":2011},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:d896fc5acb264232e417e3a4ac4d74a9b79c7cde24b2920d9d96c352bccd9344","observation_id":"8ca2d0ba-34e8-4ef2-add4-c4b84d46394e","resolution":{"observed_at":"2026-05-13T01:31:07.152932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-08T00:23:53.256906Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":"2106.15561","doi":"10.48550/arxiv.2106.15561","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soong, and Tie-Yan Liu","venue":"arXiv (Cornell University)","work_id":"5595a180-0cfd-4876-b580-2da9e262f6bd","year":2021},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:98c1146dcdae2a9a2fefcdeecef839a7bf42e1184abf921615e4308bd11b473b","observation_id":"08d3d720-e4f8-4c04-a13d-5c1743f0d338","resolution":{"observed_at":"2026-05-13T01:31:07.130156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"257e8b8c-ea68-4d3e-a31f-8ce6d642d1c8","year":2017},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:ba2a3b56a89c9a028bfad9dac073d060bf7247d76fccd0f320c98f2ec0cae0aa","observation_id":"eef2cd00-145a-49a9-b067-1d196dcbd143","resolution":{"observed_at":"2026-05-13T01:31:07.161342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaspeech 4: Adaptive text to speech in zero-shot scenarios","venue":null,"work_id":"cf69afac-e22a-4040-bcb2-16c6ba196b26","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:96de30ffcd8eb12825de4ff6d4f596f5adea563c473ef50a26926ef4234a834a","observation_id":"e2ef2b2b-b19a-421a-94f9-57f323c3fd4c","resolution":{"observed_at":"2026-05-13T01:31:07.170645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-901","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jingjing Xu, Xu Sun, Zhiyuan Zhang, Guangxiang Zhao, and Junyang Lin","venue":"Interspeech 2022","work_id":"f120749a-5601-4df3-a414-10d9b56c7834","year":2022},"citing_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:06.635613Z"},"links":{"citing_paper":"/paper/2301.02111"},"observation_digest":"sha256:7fbcbd5a052cebc642fd365292dc729747a06f62dd5cd9c4bff0f222d23787c4","observation_id":"7a4c8b93-e642-43a0-a597-66f2f12a0c7a","resolution":{"observed_at":"2026-05-13T01:31:07.082725Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":8},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 100 inbound Pith citation observations for arXiv:2301.02111."}