{"as_of":"2026-08-08T09:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0abd332a0644be580a414345cc5a0ce5bdcda6f357383abffca8f23586bc19df","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:33:50.926162Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.393626Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"reference_index":272,"source":"pdf_text","source_observed_at":"2026-05-11T10:47:44.152066Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2309.07864"},"observation_digest":"sha256:84674ed5ba722b82afb18c366f902d2af1bba911dcd4a4821ea2927ccfa866bb","observation_id":"c31f0988-d576-4e59-9964-a9dc3a1e4237","resolution":{"observed_at":"2026-05-11T10:47:52.719788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:589b44e8750dbdc77c3851f83ee4dc846d226f811bb816e928ef6c7f77c7cc71","observation_id":"979bebc8-0d3e-45fd-8ca7-22bb17eac15d","resolution":{"observed_at":"2026-05-15T12:26:37.352136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:21ec6ce77232cf8c2eefa0d3dd1ffa69739c033d99a422a5f272794db2a32dc9","observation_id":"8685f695-97b5-4632-b1b4-a12fb11e367b","resolution":{"observed_at":"2026-05-16T06:06:41.570236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T15:33:50.926162Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling.arXiv preprint arXiv:2303.03926, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-08T04:51:39.118604Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:50.926162Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.14648"},"observation_digest":"sha256:3e2c0b689afe8c6e003a6fef56aef7a4f66be553e94145ef53c2cd95caacdf13","observation_id":"240147d3-4c80-4585-b45b-8d478dd37758","resolution":{"observed_at":"2026-08-07T15:33:50.926162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T15:23:15.604779Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.604779Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:1ac02c026981a0da387d1099b0730c06370fb32d9152118803b90ed3497229e2","observation_id":"64fe4a74-6347-4730-9265-6015099d6104","resolution":{"observed_at":"2026-08-07T15:23:15.604779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T14:19:53.462342Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling.ArXiv, abs/2303.03926, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.462342Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:3b9d2cd6e68a3420c573ceb47798dfc84e9cdf76efc08f95ee97f718d4f70ad3","observation_id":"7e1872e8-7f8e-468d-bf75-a5acd1a15bc1","resolution":{"observed_at":"2026-08-07T14:19:53.462342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T14:15:55.227783Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-08T07:23:29.747553Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.227783Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:a6b223e0d9be57afd2fde00f7a2acbe6c13310d4ba66a80f6cdbe8e81f9f0fa6","observation_id":"fab4a743-7c6c-42bb-a1ab-0ef3ae3e293a","resolution":{"observed_at":"2026-08-07T14:15:55.227783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T13:23:07.320866Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22054","last_updated":"2025-05-28T07:24:40Z","snapshot_observed_at":"2026-08-07T13:13:54.386349Z","submitted_at":"2025-05-28T07:24:40Z","title":"Voice Adaptation for Swiss German","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:07.320866Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.22054"},"observation_digest":"sha256:ca63363b36679446d34ecbcc798380d8e5dafcefff3bccfd0dccfb192521e00a","observation_id":"f148466c-20d9-4340-a9ed-b9aedfd7a3f6","resolution":{"observed_at":"2026-08-07T13:23:07.320866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T12:45:31.620520Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23619","last_updated":"2025-05-29T16:26:32Z","snapshot_observed_at":"2026-08-07T12:39:39.469021Z","submitted_at":"2025-05-29T16:26:32Z","title":"Few-Shot Speech Deepfake Detection Adaptation with Gaussian Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:31.620520Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.23619"},"observation_digest":"sha256:31221b0b4ca47da84a8055e7c0c05b88e584c43f1e262de3629d20b10786bea4","observation_id":"7ab4c217-426d-4035-a07d-ab117c4c1ffc","resolution":{"observed_at":"2026-08-07T12:45:31.620520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T11:56:29.091198Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01020","last_updated":"2025-06-01T14:04:08Z","snapshot_observed_at":"2026-08-08T01:41:10.761298Z","submitted_at":"2025-06-01T14:04:08Z","title":"DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:29.091198Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2506.01020"},"observation_digest":"sha256:391b969a14908715a2ee5ddfa3e598694a22f44750db734dc2cadfb1ae13c156","observation_id":"9a7b921a-32ce-4f59-9765-7ed4dbf538f6","resolution":{"observed_at":"2026-08-07T11:56:29.091198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T10:58:30.568112Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03884","last_updated":"2025-06-04T12:22:24Z","snapshot_observed_at":"2026-08-07T21:44:08.232816Z","submitted_at":"2025-06-04T12:22:24Z","title":"Kinship in Speech: Leveraging Linguistic Relatedness for Zero-Shot TTS in Indian Languages","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:58:30.568112Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2506.03884"},"observation_digest":"sha256:93476cb40b32c47f18734d5cb507ddcd5752ca46f702cd6c631f85bfaab6e471","observation_id":"09225bfb-1e78-4efb-bf6e-b9e4b684cb17","resolution":{"observed_at":"2026-08-07T10:58:30.568112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T23:35:36.334752Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-07T23:23:01.221709Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.334752Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:a138781b55105ac93f52d070077edb11198706c65cb05d41207a3c33209ac364","observation_id":"e58d9ddf-40d0-4d10-893d-ff661ecaf7eb","resolution":{"observed_at":"2026-08-06T23:35:36.334752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T19:21:03.927154Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.927154Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:b93e3304b61f809c431db918b0ced63a970eb06c3b6b369096302671719580c9","observation_id":"b87f9175-72f9-4052-ba6c-4c17668cba53","resolution":{"observed_at":"2026-08-06T19:21:03.927154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T18:36:07.615777Z","title":"Zhang, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07799","last_updated":"2025-07-10T14:26:28Z","snapshot_observed_at":"2026-08-08T00:24:15.711420Z","submitted_at":"2025-07-10T14:26:28Z","title":"SecureSpeech: Prompt-based Speaker and Content Protection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:07.615777Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2507.07799"},"observation_digest":"sha256:aed0dc9ffcbe90bc680d82f9b1f582d4e89d10ed8d5496d679f90a1f402d1692","observation_id":"78b9d3b1-68ef-4d18-ae2e-3aabd768eb0f","resolution":{"observed_at":"2026-08-06T18:36:07.615777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T11:22:27.950994Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.950994Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:ee953d5afb602ebf165073b9e68cfd63f5837dcb93c1a946a6dbfdf74eaaceee","observation_id":"d4517a79-8173-4f65-8551-ffcd886f9f98","resolution":{"observed_at":"2026-08-06T11:22:27.950994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-05T22:17:38.301601Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.301601Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:3c59ab8e9e584434b81fb0f1e9abfa32f8cfba574673bff575585ad040c4e9e7","observation_id":"64a33c59-d966-4a47-b022-18342097d1b9","resolution":{"observed_at":"2026-08-05T22:17:38.301601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-05T16:01:52.883671Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.883671Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:b572590c6a84beb69f574604c922f28a7e3bfb91a0afec01a2b8cf9775f4accd","observation_id":"d9c9843c-e0b0-4d37-9727-f0540ccd7d32","resolution":{"observed_at":"2026-08-05T16:01:52.883671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-04T18:51:21.136655Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-06T15:26:13.717443Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.136655Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:420796e71feadcfed798cd1617e9e751bd66d62229cdfc150ad93538648e2800","observation_id":"9dc06219-a9e9-4be9-b4e1-e28e44f6aed5","resolution":{"observed_at":"2026-08-04T18:51:21.136655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2509.19883","last_updated":"2026-04-11T06:12:16Z","snapshot_observed_at":"2026-08-02T07:43:41.108992Z","submitted_at":"2025-09-24T08:34:19Z","title":"CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T14:34:15.220263Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2509.19883"},"observation_digest":"sha256:0aa2de34dfce2de7cddd19fa99c0fd8b37beafa8cea46aa1cda923591095fe9a","observation_id":"c93a56ef-7037-49ee-95c9-33e0a5070a7b","resolution":{"observed_at":"2026-05-18T14:36:28.826038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-03T00:11:18.974337Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12304","last_updated":"2026-07-23T11:24:08Z","snapshot_observed_at":"2026-08-03T00:11:08.466564Z","submitted_at":"2026-02-12T03:25:41Z","title":"OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T00:11:18.974337Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2602.12304"},"observation_digest":"sha256:289046c17deb84e8313636068dd3fbb3a213ef5c1154e15d7518e763fdb3fcb4","observation_id":"488ae25c-b8e7-4ae2-b441-d6cc262f33b1","resolution":{"observed_at":"2026-08-03T00:11:18.974337Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2603.14267","last_updated":"2026-04-03T07:45:32Z","snapshot_observed_at":"2026-07-06T22:49:06.164294Z","submitted_at":"2026-03-15T07:53:23Z","title":"DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T11:56:13.914121Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2603.14267"},"observation_digest":"sha256:c8f78659ee0167b0acef0f38e2e8eeb3a185bc4bbaec5e85bc5d9af0adbd3112","observation_id":"84b0e2ae-172b-42a0-a79f-bcfdf1f1c229","resolution":{"observed_at":"2026-05-15T11:59:59.597146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2604.11917","last_updated":"2026-04-13T18:06:43Z","snapshot_observed_at":"2026-08-03T02:56:46.845708Z","submitted_at":"2026-04-13T18:06:43Z","title":"StreamMark: A Deep Learning-Based Semi-Fragile Audio Watermarking for Proactive Deepfake Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:43:16.998414Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2604.11917"},"observation_digest":"sha256:290f650986b75890585b6d1e540f9a90da653495cc1cb1bdb6bc75fb7535e1b6","observation_id":"a5fd5a40-14db-4ffa-b6e1-e1094da1f026","resolution":{"observed_at":"2026-05-11T09:56:05.181855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2604.17435","last_updated":"2026-04-19T13:34:52Z","snapshot_observed_at":"2026-08-03T18:14:19.780984Z","submitted_at":"2026-04-19T13:34:52Z","title":"MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T05:36:07.090627Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2604.17435"},"observation_digest":"sha256:4e7e589630995432d971c19a3102cf9b2f13c6541447d56a2bea7de5f12de835","observation_id":"3a70b231-b3aa-409c-87f2-0ca65bf922f5","resolution":{"observed_at":"2026-05-10T05:41:02.473621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2604.23295","last_updated":"2026-05-25T03:30:22Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T13:18:40Z","title":"Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:16:47.522489Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2604.23295"},"observation_digest":"sha256:c604c97c5b5427f98e799fc1f7115788c9c573215db10bfe4d046e1fe98f3aca","observation_id":"22772b80-26cd-4144-8f72-ad74a903bf89","resolution":{"observed_at":"2026-05-11T20:41:13.516306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-07T04:24:17.978376Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T04:35:58.032597Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:3e89b31b24f329b3155e24d5c0dab070e3657cdfd70925e31232cf5eaebcd807","observation_id":"dddbbbb0-4ae5-4e67-9b5d-be997bff803b","resolution":{"observed_at":"2026-05-11T21:41:16.042449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-07T04:24:17.978376Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T01:43:48.555523Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:e5b7df8b43f7b906ce3231463a90b700631aed182eef8472f455e808977c9317","observation_id":"8abf31f5-c8c4-4ebf-ba4c-3459173fd0dd","resolution":{"observed_at":"2026-05-12T01:46:13.915078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:9f376fc4bc001aa5fad9025eb262f607120ab73c8f058ea1228b6e40a370ac52","observation_id":"11430ff3-1019-4358-86c2-e879e4a3d3d3","resolution":{"observed_at":"2026-05-20T14:13:21.333971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:3f995498b89bfb047931678d8bcb5842408ba34fc52f78c47e8f60612c6cfde9","observation_id":"f3ef0fae-32a5-48a0-bb78-c852c98aca91","resolution":{"observed_at":"2026-07-02T05:16:39.842971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2606.05739","last_updated":"2026-06-17T07:32:27Z","snapshot_observed_at":"2026-08-07T09:41:53.120023Z","submitted_at":"2026-06-04T06:04:18Z","title":"Do speech foundation models perceive speaker similarity as humans do?","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T00:06:34.841809Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2606.05739"},"observation_digest":"sha256:b94c4f1737289b77d7881564511bb43a6606e6f3ea03d9743536e36de202d499","observation_id":"03a2684a-eeb9-4fbf-8e07-d08c633d1569","resolution":{"observed_at":"2026-07-02T14:57:04.871209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2606.05852","last_updated":"2026-06-04T08:27:17Z","snapshot_observed_at":"2026-08-04T06:57:18.394840Z","submitted_at":"2026-06-04T08:27:17Z","title":"UniVoice: A Unified Model for Speech and Singing Voice Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T23:56:14.198308Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2606.05852"},"observation_digest":"sha256:47fb745b11647913264610a5eb9f9c55cb7ba3eba704c944781c53954978e2c6","observation_id":"b51ec42e-5a70-42bc-bcd1-f49e35a5c523","resolution":{"observed_at":"2026-07-02T15:17:08.306137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2606.25403","last_updated":"2026-06-24T05:02:36Z","snapshot_observed_at":"2026-08-01T01:01:18.146622Z","submitted_at":"2026-06-24T05:02:36Z","title":"CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T20:21:47.681999Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2606.25403"},"observation_digest":"sha256:d6648738e6e1cb4e2eeb12ded0833e41e3786f7eff0b0f4c6f86882a2cf916d0","observation_id":"eff54b84-0495-4ced-a6c8-cb7fbd651d5d","resolution":{"observed_at":"2026-07-04T20:20:07.156796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2606.26534","last_updated":"2026-06-25T02:18:24Z","snapshot_observed_at":"2026-08-05T06:20:13.047671Z","submitted_at":"2026-06-25T02:18:24Z","title":"VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T03:26:22.529879Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2606.26534"},"observation_digest":"sha256:e2632fe206b4b6b4a2e0832bcac9c721f92c0353226712609e880ed3f088d900","observation_id":"23bea1f1-e3f1-4cb7-a49c-5a9264df1192","resolution":{"observed_at":"2026-07-04T14:39:57.036118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":235,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:14c3f0e0b0babc8808c0779539444b04258fb5f171f7f2b8e1204a6840d27f26","observation_id":"03b696fa-7ee1-4897-96cd-1ece412df834","resolution":{"observed_at":"2026-07-08T00:04:22.394850Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2303.03926 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":235,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:a657cfe2e7c7294b664194abe34e07e82112a41ff0dc55d095197e5bd195a1eb","observation_id":"e6fa88f4-b57b-4f87-ade2-356a59d72afa","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-01T21:50:08.442744Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.442744Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:da3bdd39a4b470c7b21e34e865436257c1d8814429a9c09c32c4c781ac42319a","observation_id":"487ed536-8ec9-4116-a1b7-b26693617478","resolution":{"observed_at":"2026-08-01T21:50:08.442744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.03926/citation-record","integrity":"/paper/2303.03926/integrity","json":"/paper/2303.03926/citation-record.json","paper":"/paper/2303.03926"},"outbound":[],"paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2303.03926."}