{"as_of":"2026-08-08T02:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcd3b1cd22f760eb98b2bb323cde47f0b76b0208e524acf26f952b01fc94445c","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:53:18.993310Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17426/citation-record","integrity":"/paper/2505.17426/integrity","json":"/paper/2505.17426/citation-record.json","paper":"/paper/2505.17426"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:53:14.619002Z","title":"Seed-tts: A fami ly of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.619002Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e560551bc847862899e0f694a255e5ed814a6bc687c9bcc911b8c28b70e0421b","observation_id":"9d33002b-6b3c-47b2-89c1-3fcdaa12fcef","resolution":{"observed_at":"2026-08-07T14:53:14.619002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.538882Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech represen tations","venue":null,"work_id":"bf583fc6-f886-40ef-9905-ecfdef6389da","year":2020},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.670603Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e171fd0a127681bdfaa5331633c0637b4401161fd9d7f038bf3dec3a71704601","observation_id":"e4d26acb-124c-476a-b934-3f4e48d06b50","resolution":{"observed_at":"2026-08-07T14:53:23.656153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T14:53:14.733869Z","title":"F5-tts: A fairytaler that fakes ﬂuent and faithful speech with ﬂow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.733869Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e46bd2e3e4750e15f1af7655a30bc093bca54534baba5187f5462ae41891e516","observation_id":"966c5132-20c0-440d-b084-c0e5db6586e4","resolution":{"observed_at":"2026-08-07T14:53:14.733869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T14:53:14.823243Z","title":"High ﬁdelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.823243Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:b1d27dfd0e5e4aa78ed92992efb60ddb8233d75b8809a76c98e31bc2b596a689","observation_id":"ec869804-b9ce-409a-9c1f-486251b2b3c6","resolution":{"observed_at":"2026-08-07T14:53:14.823243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:53:14.907708Z","title":"Moshi: a speech-text fou ndation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.907708Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:5c54201dfa5cf1c332bb0fdcdcd85906d1183c72b34bd89e8bc7ba2f6d48848b","observation_id":"213665fe-a09a-410c-8c8e-d40078715e2e","resolution":{"observed_at":"2026-08-07T14:53:14.907708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-05T17:33:03.736753Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-07T14:53:14.979998Z","title":"Indextts: An industrial-level controllable and efﬁcient zero-shot text-to-speech syste m","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.979998Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:4ae877c4b0e5902879b111a871a9ddeb996c940f050fddcb246353c0f4b5753f","observation_id":"cceffa41-b9b1-4038-bf68-672cd9a46730","resolution":{"observed_at":"2026-08-07T14:53:14.979998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T14:53:15.064261Z","title":"Cosyvoice: A scalable multil ingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.064261Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:163df763513704e489feb5e2c2c033a0c7fbbce728affa56af7d928ffc8942d6","observation_id":"e607820d-e8a4-430f-955c-79c2edb8e86d","resolution":{"observed_at":"2026-08-07T14:53:15.064261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T14:53:15.130965Z","title":"Cosyvoice 2: Scalable s treaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.130965Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:4a16ed6e903df5c24dd8fff1a1a87ef286f7ba9511ba50d43d898c7791f222a3","observation_id":"0facc9cb-428e-4f1e-8901-17226756ef20","resolution":{"observed_at":"2026-08-07T14:53:15.130965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T14:53:15.212421Z","title":"Paraformer: Fast and accu- rate parallel transformer for non-autoregressive end-to- end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.212421Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:93b3a656d66a8b153ef85f2f78771d81ce2a7c42cdd72d35f764e59ae9d46474","observation_id":"a113fd37-95e0-4b9c-8a1b-a3282570a878","resolution":{"observed_at":"2026-08-07T14:53:15.212421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:53:15.302882Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.302882Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3805e7be1c3a5e9f2ac3801964bca09a2657ffb72def13e5865931c563bc4fe9","observation_id":"7b0deeda-b6f5-4529-8ee7-58b20615f6a1","resolution":{"observed_at":"2026-08-07T14:53:15.302882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.381984Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"bc6543d9-94c8-480f-80e4-58da765d4a09","year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.463966Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:b0ae62950b415baac35a6aea7d4ac79bd4e2a59b5a3f91cb8684e02b76976ccd","observation_id":"2347bbc7-4675-4758-900f-fef985939400","resolution":{"observed_at":"2026-08-07T14:53:23.450367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.229806Z","title":"Hubert: Self-supervised spe ech representation learning by masked prediction of hidden units, 2021","venue":null,"work_id":"625abf91-2069-4502-b9b5-33a883e51e19","year":2021},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.590347Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:6f3a6bf74fe0eaec18951a7d4984dba44e714e0d6026b640d4549461e969b8c3","observation_id":"a56d4796-c3f9-436d-91ed-da5e3a3e48f0","resolution":{"observed_at":"2026-08-07T14:53:23.285384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-07T14:53:15.691624Z","title":"Wavtokenizer: an efﬁ cient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.691624Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:7dd6666b94b19ef763a5ce0fa60420a45d1a0c6259d7fed4491d06e366dd5d13","observation_id":"f9ef53f3-404f-46bb-8008-bc5d8b4d1de1","resolution":{"observed_at":"2026-08-07T14:53:15.691624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.107999Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and con- text","venue":null,"work_id":"5b0c321b-e0a8-4121-887c-4ce117eba391","year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.795893Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:8037ec6b54618bebcd50bf55064b4f766261ad7a4c3c45320bdc1ec187d87b46","observation_id":"fcdc4326-4c69-4601-a2ae-5b9241fa4864","resolution":{"observed_at":"2026-08-07T14:53:23.159193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:53:15.934554Z","title":"Scal ing laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.934554Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:797b7dd013cdc29f1b0508f1b63438e93038dd0d8e01edb7f9a90f19e5c265eb","observation_id":"a3f97cc6-f5d9-4d2f-8b49-b022605b9663","resolution":{"observed_at":"2026-08-07T14:53:15.934554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:22.939718Z","title":"Hiﬁ-gan: Generative adversarial networks for efﬁcient and high ﬁdelity speech synthesis","venue":null,"work_id":"7f70e31b-e5a5-4272-adb4-9405a794b3be","year":2020},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.069772Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:0ac879ba4c3dcb57de3cc8f573f9494bc693be5a194751fd6e4fbe628d41a1de","observation_id":"dbc7af43-37c4-44bd-94e4-40c2e31177c9","resolution":{"observed_at":"2026-08-07T14:53:23.005927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-02T08:47:14.659563Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-07T14:53:16.222193Z","title":"Single-codec: Single-codebook speech c odec towards high-performance speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.222193Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:ec8517dbd7e6a0cbf236849afd35d91bd35285837747f58841e6d60f31f38f5d","observation_id":"15d8824e-45e5-40de-add5-0652964ca1f8","resolution":{"observed_at":"2026-08-07T14:53:16.222193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T14:53:16.316201Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.316201Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:eff238ff5cadac01ad17bc9f2704550c84362ae05db0fbdd07f5119a9e3c230b","observation_id":"1bafbe8f-77ba-41e9-bc48-584777613c6e","resolution":{"observed_at":"2026-08-07T14:53:16.316201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:16.366904Z","title":"Unitok: A uniﬁed tokenizer for visual generati on and understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.366904Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:bc0c3e88b88bf30cbc8002d18133bbc1dbeacb88db96b5a72fa5df862ffc2726","observation_id":"d7a1aebb-b7f9-4d63-b941-2dfb44717064","resolution":{"observed_at":"2026-08-07T14:53:16.366904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-07-06T18:27:45.631190Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-07T14:53:16.449290Z","title":"Wenetspeech4tts: A 12, 800-hour mandarin tts corpus for large speech generation model benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.449290Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:a21146dfda7eed94a50566957a52aa05070f56dd933b85a6c25a13bf0c5429d1","observation_id":"30bb3cbe-ee07-4b8c-98c1-e66a3eca2135","resolution":{"observed_at":"2026-08-07T14:53:16.449290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-07T14:53:16.516851Z","title":"Autoregressive speech synthesis without vector quanti- zation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.516851Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f36c4ddf2d8815f793c2c060b5d25fed00a36fb8c8b109ce94e43cb903fa8daa","observation_id":"10d591a9-3c72-4840-b415-418f7995e5cd","resolution":{"observed_at":"2026-08-07T14:53:16.516851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T14:53:16.616864Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.616864Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:b22559e6ffdde4298bdfda59924387cd0b99f774b2ed34d74dba29d9a94341ba","observation_id":"e04f95dd-98d0-4488-a399-b92592437938","resolution":{"observed_at":"2026-08-07T14:53:16.616864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-07-06T19:59:01.756640Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-07T14:53:16.774762Z","title":"Scaling transformers for low-bitrate high-quali ty speech coding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.774762Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e7d2b75c422b88b9f0bca415501914267f46d23a1828de8e78c1b3bb6a79acf6","observation_id":"53fa332c-d27a-43da-966e-4b834a73cad8","resolution":{"observed_at":"2026-08-07T14:53:16.774762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.666012Z","title":"Loss-sensitive generative adversarial ne tworks on lipschitz densities, 2018","venue":null,"work_id":"b74f0a9e-6f12-40c7-a2a7-db235f06b5d8","year":2018},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.862660Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:df57330a278d7a4b785e7f3f7061ecf8337079db3a33bbc6cab3377ee888f06f","observation_id":"72b749f9-c540-4490-8fa4-134eb682d2ac","resolution":{"observed_at":"2026-08-07T14:53:22.341747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.439658Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"73a15e11-46ef-428a-b48e-e0d66bb9b0c1","year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.955473Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3e879624389d6f093d186c7517a788faf1ef59c823717130b3be6d2ce9cb289f","observation_id":"87751d8b-54bb-406f-aeb7-ba408ac83444","resolution":{"observed_at":"2026-08-07T14:53:21.518013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.297420Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"70070eec-a8d3-42dd-b97b-db1a042eebe1","year":2019},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.076214Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e285dc4564d1a518b96086501d982258698b64d62bf906bd0a40166032b44041","observation_id":"dc727f44-2f28-4626-9890-34064b2961a3","resolution":{"observed_at":"2026-08-07T14:53:21.364048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.183395Z","title":"Direct preference optimization: Y our language model is secretly a reward model","venue":null,"work_id":"9841bf53-5534-4abe-abcd-45faa0815c40","year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.171284Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:4ee9a4a12ea80655376233cf900330c870c6a1a38a8298a4cf2e89e32bc4150d","observation_id":"f120fd47-36e9-42e9-ae14-53b979da2abb","resolution":{"observed_at":"2026-08-07T14:53:21.223798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.051824Z","title":"Dnsmos p","venue":null,"work_id":"8d8d01f0-7925-46d3-9d07-378ad7b34034","year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.261661Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:57ad5901e53a6e84029afcb73cbd9a9adbcb91e18ff76902c18d990b3800fe62","observation_id":"9701ba54-0ecd-4c53-9aae-316cfd4e8577","resolution":{"observed_at":"2026-08-07T14:53:21.106441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.909628Z","title":"Utmos: Utokyo-sarulab system for voicem os challenge 2022, 2022","venue":null,"work_id":"6d02861c-073a-42f4-b67b-4f27475ca11b","year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.331644Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:0179e95199c4905e331d88946a7b4174fa7be86bd829e104c6553d7318a6f33a","observation_id":"afef3ee6-190a-4445-9f43-6feb6b7343c1","resolution":{"observed_at":"2026-08-07T14:53:20.984555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.763704Z","title":"Neural discret e representation learning","venue":null,"work_id":"12544046-b081-4b47-92d5-02054b7f153f","year":2017},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.426791Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3f65944a4282199f87d35dd64184bc33772cb3d3544e6758b71249b5ed1c670f","observation_id":"66a420ae-6782-43af-96c9-7844c3edf45c","resolution":{"observed_at":"2026-08-07T14:53:20.810423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:53:17.522496Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.522496Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:5e8563e0b8fabb5bf83f4e545fcbc0f65a9537da838a3e742f4710a3a3b1d6c3","observation_id":"f6fd71d8-af69-4bf9-956a-c795fc93f5f9","resolution":{"observed_at":"2026-08-07T14:53:17.522496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-07T14:53:17.592637Z","title":"Spark-tts: An efﬁcient llm-based text-to- speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.592637Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:0966bad455ce9593bdf4d3881e964ce4fe3c58d799d66ecc469a0bdae1372f09","observation_id":"2a745d27-1788-4f6c-9bd8-47e1b4265e34","resolution":{"observed_at":"2026-08-07T14:53:17.592637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.632051Z","title":"Convnext v2: Co-designing and scaling conv nets with masked autoencoders, 2023","venue":null,"work_id":"b19d4961-de0e-4efb-aad8-352bc5832e6c","year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.651875Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:98922ca7f07229929be24336ba141577586db3c92af339336848b5fa39a22def","observation_id":"6b94630e-26d1-41bc-9996-33324ce4bddc","resolution":{"observed_at":"2026-08-07T14:53:20.707290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-07T14:53:17.728250Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.728250Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f74d29a44c3f1e85f7e3ddc8807072501f832cdc8212a16a2be952b7ba6c5b65","observation_id":"bdc4cb98-4edf-4f45-80c6-4ec8e460e120","resolution":{"observed_at":"2026-08-07T14:53:17.728250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:53:17.785623Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.785623Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:7501633d771b0385987e1e809e1170acec902c34dfd0afd535918bb33f5ab5aa","observation_id":"0abc68c5-c879-4e25-ab80-8811ab6e65ca","resolution":{"observed_at":"2026-08-07T14:53:17.785623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T14:53:17.856062Z","title":"Hiﬁ-codec: Group-residual vector quantization for high ﬁd elity audio codec","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.856062Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:16fb5aea940144715649c6e6acd41ce652c9581e2cfa268543696a928cc5dad2","observation_id":"c17515ea-574e-4cd3-9cdd-f3aa64e2267c","resolution":{"observed_at":"2026-08-07T14:53:17.856062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.496764Z","title":"Codec does matter: Explo ring the semantic shortcoming of codec for audio language model","venue":null,"work_id":"52f5613a-61d4-4927-97ce-fe4f6c91b971","year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.908432Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:21234ce8ab2d07a05631911d76ee84b8fc695701a5276a5ae300c4a32a41bbb4","observation_id":"e3ba37b1-24a5-4a5c-a7e0-b44ff18477d7","resolution":{"observed_at":"2026-08-07T14:53:20.545166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-07T17:49:42.104594Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-07T14:53:17.983678Z","title":"Llasa: Scaling train-time a nd inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.983678Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:026d318ced41e3b451ea8d1b3d2eae94ade4fb446da930571451f3bf11764261","observation_id":"7f6a92ec-8d1c-4ad1-af56-c56ba9d1e6b1","resolution":{"observed_at":"2026-08-07T14:53:17.983678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T14:53:18.048407Z","title":"V ector-quan tized image modeling with improved vqgan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.048407Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:2e7117e2798c1f35127e8ae7b3aec0ebfb14360a1c6fb925d940a02a68b80705","observation_id":"e4532399-60e4-4eed-a94b-1a509428d199","resolution":{"observed_at":"2026-08-07T14:53:18.048407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.361768Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":"fe4b3631-5dde-445d-a981-280055d2bdac","year":2021},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.148272Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:6f8aaf4562948e86c0c1eb38e9021be9646fc417a49592a21c6ef0e2c792a8c1","observation_id":"87603f81-26c6-43e7-9b68-d341b58d5cb1","resolution":{"observed_at":"2026-08-07T14:53:20.421251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T14:53:18.271919Z","title":"Speechtokenizer: Uniﬁed speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.271919Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3745c0a7313d4082874de05f861056e3ee5caec5fd75b6fb00c650c3fd1898b5","observation_id":"1af4cf71-c62d-4614-881a-7eb6c32833fc","resolution":{"observed_at":"2026-08-07T14:53:18.271919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-08-07T14:53:18.403349Z","title":"Scaling th e codebook size of vqgan to 100,000 with a utilization rate of 99%","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.403349Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f7c8d8ba52d026c41a8f6f8769db7f5b71089a5b1143fc6167d5fa990c446178","observation_id":"dee18e11-8a7f-4bf7-bd7a-55144e5b916e","resolution":{"observed_at":"2026-08-07T14:53:18.403349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:18.507278Z","title":"Autoregressive spe ech synthesis with next-distribution prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.507278Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3331389858a58eb1ed5c297e46d5f73e5ef1f28d5509a34601b07c679a55efd7","observation_id":"bf398295-290a-4cd1-a408-de9d69fe6597","resolution":{"observed_at":"2026-08-07T14:53:18.507278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.169177Z","title":null,"venue":null,"work_id":"26ba1e9c-6711-464a-a8f8-df3bbc69b694","year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.615503Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:9d029834b9c4aebc13e51789ab55a37e0a78de3b8aba8f49d0644fa040fef758","observation_id":"40441d08-839b-4330-9113-0461d391477a","resolution":{"observed_at":"2026-08-07T14:53:20.293072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:19.982427Z","title":null,"venue":null,"work_id":"6869f2d4-ea00-4389-b866-695acb415547","year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.743653Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:8fd1b49f8fa6c474f42760aaf71cabd2b81b94cbf3011b83c16c6bf1614c550c","observation_id":"409776ea-b68d-4b8a-874b-af7b89ec1c41","resolution":{"observed_at":"2026-08-07T14:53:20.071455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:19.766938Z","title":null,"venue":null,"work_id":"07dd6d89-d041-4719-8c0e-1d8490b9d469","year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.852069Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:8f8dd10b4d0c51aa6d7a27abdb25f6d545688bea2ae5b03552c969c9975b11df","observation_id":"04b30b9b-3f9c-483b-ab74-e59c35936428","resolution":{"observed_at":"2026-08-07T14:53:19.867514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:19.562304Z","title":"16 Table 13: Multi STFT Discriminator parameter settings of Di stilCodec","venue":null,"work_id":"21aef50e-93c3-4c6b-98f3-ff11cfcbbce5","year":2000},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.993310Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:addf8755ae21e7ae77c425eab62ffab119cdd8e41e8b92ce717c99c0bcb1c8aa","observation_id":"173d7a8f-9474-45ea-9412-76d0b909fe51","resolution":{"observed_at":"2026-08-07T14:53:19.646311Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2505.17426."}