{"as_of":"2026-08-17T12:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:756236b0365833a07674720067c12045992af2065cdf84bc5d59269507d50149","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:36:21.772183Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11650/citation-record","integrity":"/paper/2608.11650/integrity","json":"/paper/2608.11650/citation-record.json","paper":"/paper/2608.11650"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-16T00:36:21.591905Z","title":"Seed-TTS: A family of high-quality versatile speech generation models.arXiv preprint arXiv:2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.591905Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:ab83c45bbbe058653dc5a473afeabd8c1b2bc5b9e0158aa0e87e980d57331a69","observation_id":"522995db-b11a-42d5-a5e9-e411b986dd1d","resolution":{"observed_at":"2026-08-16T00:36:21.591905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-17T03:27:03.725457Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-16T00:36:21.597148Z","title":"Better speech synthesis through scaling.arXiv preprint arXiv:2305.07243, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.597148Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:bd94a99524836df060c232bdaaee8becf92622f24188ddb4d123355ebe9644f5","observation_id":"91f0d584-4046-4020-99df-8a05eae7e989","resolution":{"observed_at":"2026-08-16T00:36:21.597148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-16T17:28:53.714216Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-16T00:36:21.601698Z","title":"XTTS: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.601698Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:c03d19729309f8235d16feb700f4eef67175c96c2e54ff39cc34322262c5c045","observation_id":"168de320-8cbc-4adb-9c74-5a0875765363","resolution":{"observed_at":"2026-08-16T00:36:21.601698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.491754Z","title":"YourTTS: Towards zero-shot multi-speaker TTS and zero-shot voice conversion for everyone","venue":null,"work_id":"97d189af-df88-416b-81c6-82194d8cc153","year":2022},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.606031Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:ca6e0b40c3eb272a50666aeadb327ef2b18cefd08a98a6a141b3b8b01790e2b0","observation_id":"08e61146-fd25-4f06-8e69-9f784b6de208","resolution":{"observed_at":"2026-08-16T00:36:22.496936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.476570Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022","venue":null,"work_id":"5969eba7-72ab-4c9c-b177-ee6980e83cde","year":2022},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.609726Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:3b0137f7d33dd0b2cc23c6a42a80baa701e61300152ad984e8b7de2b76a7661b","observation_id":"307bb490-e946-4a7c-92c3-5c23997d3d48","resolution":{"observed_at":"2026-08-16T00:36:22.481546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-16T00:36:21.613843Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching.arXiv preprint arXiv:2410.06885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.613843Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:d4007289ece912a7f0cd757f1ad34e2dba110306434abe2d7bcace7159398090","observation_id":"5d63568e-4495-4fc0-8521-de52398f9c33","resolution":{"observed_at":"2026-08-16T00:36:21.613843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.462026Z","title":"w2v-BERT: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":"455d1c4b-21cf-4519-b1ec-3efbaa653f95","year":2021},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.618053Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:260ff8450b635dd335275d0ae7c666961478b6a3897975e881165c5eb28b553e","observation_id":"6eaf9818-2954-4232-ad28-8a18644b280f","resolution":{"observed_at":"2026-08-16T00:36:22.467348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-16T07:12:07.706546Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-16T00:36:21.621880Z","title":"IndexTTS: An industrial-level controllable and efficient zero-shot text-to-speech system.arXiv preprint arXiv:2502.05512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.621880Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:3fae8ad9d1e56509d5b385a08e724c8c511d7796dc0aa0b74312012158c4f5a3","observation_id":"d1e8297f-5517-4315-803e-1177a6098a76","resolution":{"observed_at":"2026-08-16T00:36:21.621880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.448027Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification","venue":null,"work_id":"6eacd5fc-dc10-4dea-be92-8bd31521d8fa","year":2020},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.626443Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:30aa0adcebe5d8d8fbcc87a5b3580ba9ef29e7699d05c9132485c202a90b4952","observation_id":"bf21efb6-8216-4119-a169-78a80e1930b9","resolution":{"observed_at":"2026-08-16T00:36:22.452706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-16T00:36:21.630552Z","title":"CosyV oice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.arXiv preprint arXiv:2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.630552Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:a32d27d1e3a0d3df7da39dc2e3f07b89a1f39d0a69ef2e328dd42f8aadf27661","observation_id":"2b3a91b3-eca5-4e8c-8f8c-d74484b897e8","resolution":{"observed_at":"2026-08-16T00:36:21.630552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-16T00:36:21.634937Z","title":"CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training.arXiv preprint arXiv:2505.17589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.634937Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:c02e0ca2bc5c2e7177fb029f01fb936f56937b298c4800f87cf2e5d08f60452b","observation_id":"77a6d468-c0c5-4318-89ad-8d6560c533b1","resolution":{"observed_at":"2026-08-16T00:36:21.634937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-16T00:36:21.639687Z","title":"CosyV oice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.639687Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:defb0d34a9f7f3949aed0e1b7db7017f5364d6b3b3824e3ee919ccedec7f9373","observation_id":"4c9e8fee-bcc0-4b66-8f6a-1823e3024333","resolution":{"observed_at":"2026-08-16T00:36:21.639687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.431765Z","title":"ElevenLabs multilingual text-to-speech, 2024","venue":null,"work_id":"a972050b-c090-4105-8eec-a97186ba532c","year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.643733Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:75814c05f16cc34f513fc8bfa9f8e636bf316bfd96d3b61102879226d72582a7","observation_id":"12761c13-59d4-4838-8a85-fc06de9715be","resolution":{"observed_at":"2026-08-16T00:36:22.436624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.418972Z","title":null,"venue":null,"work_id":"c0716041-b01c-456e-abb1-7c4035c7bb5f","year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.647442Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:0436bc236ae41cd8792ad31ca575c1e84b2fdd34b0e3ae8a88a93c51e34eb03e","observation_id":"5abfd9d1-ad6e-4e63-9de9-ed7c959a217f","resolution":{"observed_at":"2026-08-16T00:36:22.423415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.405894Z","title":"Fish audio speech-2, 2024","venue":null,"work_id":"eaf4300e-14cc-4400-bdee-255eea1dcb00","year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.651225Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:c90f33e7c631cf39355a2c83177fa349630e1ae8eee0014504f1be929272703d","observation_id":"0ac40676-6dfb-435f-aab8-561f0b362cc6","resolution":{"observed_at":"2026-08-16T00:36:22.410694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.391950Z","title":"CV3-Eval: The cross-lingual evaluation benchmark of CosyV oice 3","venue":null,"work_id":"d2fec146-48c8-46cb-9f7a-ec0772d14f7b","year":2025},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.654719Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:93c43f7ecc3a5af78d522bbac6d104098ecdf44482b89e2055dde6470165e73d","observation_id":"d1b00463-796a-4ac9-9366-52cceed22412","resolution":{"observed_at":"2026-08-16T00:36:22.396763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.377029Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition.Proceedings of Interspeech, 2022","venue":null,"work_id":"11b8c0ea-9eff-4042-966b-e1df3c932662","year":2022},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.658544Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:5dfcea303a38503139c98d878eeed316fcd242de205ce01376be17360266a4c2","observation_id":"a0972a56-f80c-46fc-a82b-3175a160d78c","resolution":{"observed_at":"2026-08-16T00:36:22.381557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:21.662138Z","title":"MOSS-TTS technical report.arXiv preprint arXiv:2603.18090, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.662138Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:da46596815ae55e57393d60aa12db28bd694410292eee5d3037a28e87be2a20d","observation_id":"0714bb5c-6e1f-4cac-bf3f-280becf7cd01","resolution":{"observed_at":"2026-08-16T00:36:21.662138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-16T00:36:21.665862Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.665862Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:48abd5b8299d8f296afb8cccc5684b53fc37f61fa3568e99b2ab3ffa877a85a3","observation_id":"a065e00d-6607-4303-afb9-a04c549ece6d","resolution":{"observed_at":"2026-08-16T00:36:21.665862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-16T00:36:21.670968Z","title":"Qwen3-TTS technical report.arXiv preprint arXiv:2601.15621, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.670968Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:e5fffa0baa92a1b9bd81eb686ead532a9d1d20da3a2ba585558ae42cc4eeba58","observation_id":"254a2655-16a3-4a86-a49d-20a7c8408ab7","resolution":{"observed_at":"2026-08-16T00:36:21.670968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T00:36:21.675743Z","title":"Jiang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.675743Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:c1acba9a06ed487f34896ad9607d5af9c0eaf93df55220e30fea38522d971dbf","observation_id":"a488129c-6f09-40eb-8ab4-ef4ab1757731","resolution":{"observed_at":"2026-08-16T00:36:21.675743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.363485Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":"f9eb218f-2e2a-47d5-a482-93f96a89ed27","year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.679369Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:3f37cf14bc7e37b37ca531db92ccaef6963c3d861b7031f0ee81e11aeb93dfa5","observation_id":"457fcc10-450a-4318-bd55-271b957749f9","resolution":{"observed_at":"2026-08-16T00:36:22.367751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-16T00:36:21.682711Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.682711Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:c057d29a392882d6b3fbcc89140de7181f64c86b2315596e11ad3f28f3f14bec","observation_id":"0556a7c5-451b-4c06-94bb-3e5db3357557","resolution":{"observed_at":"2026-08-16T00:36:21.682711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.349500Z","title":"BigVGAN: A universal neural vocoder with large-scale training","venue":null,"work_id":"6b696b39-b400-4fa0-b4ee-8da16d64a7e3","year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.686299Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:f0c5c727a987812d98c4bbf3ba131091f97f803281d5dd1e00e587fce3754dab","observation_id":"1ee8c75a-397e-4216-9bbc-02691f87df44","resolution":{"observed_at":"2026-08-16T00:36:22.354329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03888","last_updated":"2026-08-08T09:34:54Z","snapshot_observed_at":"2026-08-13T06:39:12.381210Z","submitted_at":"2026-01-07T12:58:16Z","title":"IndexTTS 2.5 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03888","snapshot_observed_at":"2026-08-16T00:36:21.689699Z","title":"IndexTTS 2.5 technical report.arXiv preprint arXiv:2601.03888, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.689699Z"},"links":{"cited_paper":"/paper/2601.03888","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:37b6d22c78f51b29dad2460617985b87141160b0ea6db6c0e85cb963765b6fdb","observation_id":"e16a0760-7edd-4ee4-b87d-cdc3a09394ed","resolution":{"observed_at":"2026-08-16T00:36:21.689699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.332388Z","title":"Flow matching for generative modeling","venue":null,"work_id":"1f549a3a-eb53-4f69-a72b-94e98745aed6","year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.693711Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:9e076deecd8d52584b0634c0f41f341b5add84cc746d5deea36e236beebc4bcb","observation_id":"334e7c7d-3041-48b5-a39b-e8664ebd08f0","resolution":{"observed_at":"2026-08-16T00:36:22.337702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14579","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:21.973489Z","title":"Cross-lingual F5-TTS: Towards language-agnostic voice cloning and speech synthesis.arXiv preprint arXiv:2509.14579, 2025","venue":null,"work_id":"9f4c91a9-8c2a-4741-a565-b3fe869e0afc","year":2025},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.697166Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:631ec3c206a98d4dbe6b8ed202cb1707f08c10c6a7efe7bb8835ddc49596760d","observation_id":"eb3de67e-0a51-43a5-b732-6d357ce07bf0","resolution":{"observed_at":"2026-08-16T00:36:21.981418Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-13T06:34:37.505459Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-16T00:36:21.700908Z","title":"Zero-shot voice conversion with diffusion transformers.arXiv preprint arXiv:2411.09943, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.700908Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:5b3a0bb71d2a8b598a205f4b5380b626b4ff14265d053a64ae34b7837a99b781","observation_id":"5dd4ecca-953a-4bad-8f56-b72790ca8ef1","resolution":{"observed_at":"2026-08-16T00:36:21.700908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:21.705297Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.705297Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:b5bd0cc7cff379f669579527ecefdb183cf1264a5f92f5ea56451d0fba593597","observation_id":"ddc50cef-a039-4e7c-ae10-aad928a72906","resolution":{"observed_at":"2026-08-16T00:36:21.705297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03199","last_updated":"2024-01-09T21:02:34Z","snapshot_observed_at":"2026-08-16T15:02:44.909438Z","submitted_at":"2023-09-06T17:59:57Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03199","snapshot_observed_at":"2026-08-16T00:36:21.709109Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.709109Z"},"links":{"cited_paper":"/paper/2309.03199","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:d53c3ef45546c95463776f4c9ca63e2f65c62a05b628a41e71b87c3dfbb28f0e","observation_id":"00901e98-f154-4607-9daa-0868ec04a7d7","resolution":{"observed_at":"2026-08-16T00:36:21.709109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.302822Z","title":"Attentive statistics pooling for deep speaker embedding","venue":null,"work_id":"4ae2cde4-1dfd-453c-a659-7dfcd8a36abb","year":2018},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.715001Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:7b3f51297d58590e65608c6ac6291f97530cbb5d14996577ae81fc3cf8f72a95","observation_id":"68779867-47e2-48f7-bca3-bd55533e7e13","resolution":{"observed_at":"2026-08-16T00:36:22.307044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:21.719373Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.719373Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:13522b519d42c65eb179bb25b3c6706776147e5fa6e10d4fb128a2fed313e9bf","observation_id":"74a6e69e-a1f5-4461-8d6a-68c182873978","resolution":{"observed_at":"2026-08-16T00:36:21.719373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.281459Z","title":"Qwen-audio-3.0-tts: Freely controllable and highly robust speech synthesis with multi-stage training paradigm.arXiv preprint, 2026","venue":null,"work_id":"32b5d057-9c2f-44ac-8170-91e857ff3607","year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.723747Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:fbe4b2949c5b366009c37ebd53da6dedea9a9d7a9d4cb3a52fd54254813460e0","observation_id":"73795dc4-a4d7-496c-816f-3f3d6294f3ad","resolution":{"observed_at":"2026-08-16T00:36:22.285727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:21.727889Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.727889Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:038e2c3f7d182087b5d3ee1a390dad474e185e646290db26ff337414df370912","observation_id":"ee23f655-280d-4ca3-83a9-fd35fa2e5798","resolution":{"observed_at":"2026-08-16T00:36:21.727889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:21.731493Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.731493Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:b85aa2fd4cf8315bbea1808665425ffd3289ea2271ae3f1d52312780a739816f","observation_id":"417f6fb2-4093-4889-b312-c400a4e0a83d","resolution":{"observed_at":"2026-08-16T00:36:21.731493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.251839Z","title":"Chatterbox-TTS","venue":null,"work_id":"e796dde3-9311-4de9-b7d1-dad82b719113","year":2025},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.736094Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:dd27b515cd68641be2ab1ed78d749db112cb70cfc214af3f21729bcf4cdbf6b1","observation_id":"1844908d-efb1-4af3-9bc8-dc0d07380c8b","resolution":{"observed_at":"2026-08-16T00:36:22.257628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.235380Z","title":"Natu- ralspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":"a30d0f98-82d4-4f59-9b7d-cbce9ed61109","year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.740401Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:a31024502e6e44229d69a54ec4fd3c7259d1f6a4624c4395600aa62a838e5a52","observation_id":"4ebfec16-3416-4c58-9d42-04eb0f5a098d","resolution":{"observed_at":"2026-08-16T00:36:22.243165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-16T00:36:21.744717Z","title":"Neural codec language models are zero-shot text to speech synthesizers.arXiv preprint arXiv:2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.744717Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:89e708e84e2edf374080b5a850bfb4f8c3835783fa5158446e9fe33555603455","observation_id":"2b95ccd5-ab9b-4332-a760-f7c158ac93cf","resolution":{"observed_at":"2026-08-16T00:36:21.744717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-16T15:51:49.152928Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-16T00:36:21.748566Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking.arXiv preprint arXiv:2303.00332, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.748566Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:02427e760e847e2bf181d3ab2383296edcbfe895354d7494d66257002fa8de91","observation_id":"8cfb784c-0ac9-4fd6-a210-2d260750e22f","resolution":{"observed_at":"2026-08-16T00:36:21.748566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-16T00:36:21.752186Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer.arXiv preprint arXiv:2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.752186Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:db38f3ce75c685249afb7df9db94441c3cf72df6756d84586f0bab36b467a831","observation_id":"d2eecb1a-ea0b-4bf8-93c3-ff37f5c41f39","resolution":{"observed_at":"2026-08-16T00:36:21.752186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-14T11:48:38.526912Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":2},"cited_work":{"arxiv_id":"2605.05611","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05611","snapshot_observed_at":"2026-08-16T00:36:21.842434Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","venue":"cs.SD","work_id":"cd34e7fb-3ebf-4e57-8032-ce5c4a1d60e1","year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.756639Z"},"links":{"cited_paper":"/paper/2605.05611","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:d60b0642b3f339ad708ffb0639166213e3e7e69daaf4593b3af3edf3cce7b012","observation_id":"81cb5a0f-c28f-4f44-b65c-1dff527c1049","resolution":{"observed_at":"2026-08-16T00:36:21.848785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-17T00:54:42.765610Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-16T00:36:21.760400Z","title":"MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder.arXiv preprint arXiv:2505.07916, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.760400Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:8945a10c138797aeabeb7e796cd5ee156a3962b99541f24355ee38b4b1457337","observation_id":"a4408303-cfc5-49ef-bf47-55239e67808e","resolution":{"observed_at":"2026-08-16T00:36:21.760400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:22.219054Z","title":"IndexTTS2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"e6cedaf6-f321-4d23-9f65-df293ba3d73d","year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.764481Z"},"links":{"citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:74587c1ca3d82c50d6243c12b4235498f711672540b94e0c71e06869f2b81989","observation_id":"846ea7d4-6523-4177-a59c-7b1b2f59c24c","resolution":{"observed_at":"2026-08-16T00:36:22.224921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-08-16T17:28:12.915614Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06928","snapshot_observed_at":"2026-08-16T00:36:21.768454Z","title":"V oxCPM2 technical report.arXiv preprint arXiv:2606.06928, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.768454Z"},"links":{"cited_paper":"/paper/2606.06928","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:4a29c74983e31117c520301d30d9eb471781dcded366619440efe6cd637a5e4c","observation_id":"242cc360-1cfa-4113-afcc-df98209f47ca","resolution":{"observed_at":"2026-08-16T00:36:21.768454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00688","snapshot_observed_at":"2026-08-16T00:36:21.772183Z","title":"OmniV oice: Towards omnilingual zero-shot text-to-speech with diffusion language models.arXiv preprint arXiv:2604.00688, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.772183Z"},"links":{"cited_paper":"/paper/2604.00688","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:e1532cce36b377f63114194953453435fa112784ac54be08cae1e083e97b5420","observation_id":"92b450f3-d50b-4a05-9438-f792287449f3","resolution":{"observed_at":"2026-08-16T00:36:21.772183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T07:12:51.270019Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.11650."}