{"as_of":"2026-08-07T08:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ca01ef2fd1aa2a9fb8dd0dcb2c012371371e3f5fe1aab3545772118d5b7ae63","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:29:37.769261Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T23:22:40.218077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04593","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Univoice: Unifying autoregres- sive asr and flow-matching based tts with large language models.arXiv preprint arXiv:2510.04593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-01T23:32:05.105330Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2510.04593","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:33b7a63656ff89a8cab2eb7c7b8914e7f04af0338ed7702991870721f6c58a6d","observation_id":"5f63ffd4-b4db-46af-bcd5-efd1c1592850","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.04593/citation-record","integrity":"/paper/2510.04593/integrity","json":"/paper/2510.04593/citation-record.json","paper":"/paper/2510.04593"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T11:29:29.467286Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:29.467286Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:e9e2be6231e15f23063bc9fdd17acef15804fbc4cf4397b99ce50c978d8ce2fb","observation_id":"12a057a4-a5ff-44ae-8397-fb0cae38e85f","resolution":{"observed_at":"2026-08-04T11:29:29.467286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-04T11:29:29.545439Z","title":"B.; Lozhkov, A.; Bakouch, E.; Blázquez, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:29.545439Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:e0b6715e0057b6060f995b2e73495bdcd408264d2e48e6e689c111c699d2e79a","observation_id":"9f9bbc3c-dde2-4b00-a95d-8f2a57a21ed7","resolution":{"observed_at":"2026-08-04T11:29:29.545439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-04T11:29:29.658196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:29.658196Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:6561ad8cea5c1341d4582c83f88179a26ea65df286642c5e9bc49b372712072b","observation_id":"ad9c0fc2-96f3-42d0-8681-5988cbee1899","resolution":{"observed_at":"2026-08-04T11:29:29.658196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-08-04T11:29:29.783850Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:29.783850Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:f7c800a35cc6cf2bf0037c624a7bae786ab4aa62706822dcd7119d6e3c719291","observation_id":"4cc58584-f19d-4b4d-8286-78ba2c0b84b0","resolution":{"observed_at":"2026-08-04T11:29:29.783850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T11:29:29.906357Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:29.906357Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:6ceb7ccc3f005025c3c10b2f122dcc1b03ed2a6ee384c2f86a4e00edfe1c9f37","observation_id":"e611af48-f6d8-4ec5-a2f4-30d2688536a1","resolution":{"observed_at":"2026-08-04T11:29:29.906357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-04T11:29:30.053883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.053883Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:efeeb0f611373f58e54df24cfb5f2c0bc08f3282860b44b6d8cb3c728205dde6","observation_id":"326f4580-d5aa-41b9-b654-8a60e83ef953","resolution":{"observed_at":"2026-08-04T11:29:30.053883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:30.168637Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.168637Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:57649c24c4d051c3abffce810aba69c8b56ddb341acbd950568bcda5ea42c22e","observation_id":"ca4f056e-b5cd-4220-ba98-417bf6a7d051","resolution":{"observed_at":"2026-08-04T11:29:30.168637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:30.306366Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.306366Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:3d975cda1c191798997047cf48e0a33e7acd8447f96ed66dd78f711ae5801a5c","observation_id":"b5b976f7-7195-4694-b649-e9204fc094b6","resolution":{"observed_at":"2026-08-04T11:29:30.306366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-06T08:54:58.638188Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-04T11:29:30.396377Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.396377Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:0e5399cae84d32d2b5253cecd773150f429024ec0697bebd31d3f95df2c921e0","observation_id":"0a66343d-5dab-48a9-871d-109ba2cbdaee","resolution":{"observed_at":"2026-08-04T11:29:30.396377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:30.523441Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.523441Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:d04ee59961d520a4a53feb643015b5149da1dc0663a60e12b2964b14b3d9f1fc","observation_id":"73ca40a1-c953-4676-b024-e5b556234cfb","resolution":{"observed_at":"2026-08-04T11:29:30.523441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-06T10:35:16.608201Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-04T11:29:30.654795Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.654795Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:a10d06a159a8b13480094b4908fc6a869d0ef9001095f0e97dd6320496a350d0","observation_id":"be8b3450-5551-4e9d-97c3-ecd45d3e549a","resolution":{"observed_at":"2026-08-04T11:29:30.654795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-03T16:28:18.429985Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15649","snapshot_observed_at":"2026-08-04T11:29:30.772401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.772401Z"},"links":{"cited_paper":"/paper/2412.15649","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:e3ad98c3410117218f37383459fbd92fcdd37298b1f12d120d73c1eac4c42173","observation_id":"81f83c4b-45f8-43b8-9d37-016b0153cecf","resolution":{"observed_at":"2026-08-04T11:29:30.772401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-04T11:29:30.853473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.853473Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:415b162fef5852adfde3b282d505f53768429880db9df6419deee6a976b33155","observation_id":"33ab5622-c8eb-4cf2-a821-eedc99c37674","resolution":{"observed_at":"2026-08-04T11:29:30.853473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03070","last_updated":"2021-05-31T11:05:43Z","snapshot_observed_at":"2026-07-06T11:07:08.503991Z","submitted_at":"2021-05-07T05:31:34Z","title":"SpeechNet: A Universal Modularized Model for Speech Processing Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03070","snapshot_observed_at":"2026-08-04T11:29:30.978703Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.978703Z"},"links":{"cited_paper":"/paper/2105.03070","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:ddcb17d41477901411108a8e6262b83353274674a6f8c5bb9627fe7da4b19886","observation_id":"0acea275-804f-4114-b4a3-0986b44f2cc7","resolution":{"observed_at":"2026-08-04T11:29:30.978703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13979","last_updated":"2020-12-15T23:19:19Z","snapshot_observed_at":"2026-07-06T09:32:26.221291Z","submitted_at":"2020-06-24T18:25:05Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13979","snapshot_observed_at":"2026-08-04T11:29:31.132461Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.132461Z"},"links":{"cited_paper":"/paper/2006.13979","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:790f1f6f389d0f78933a0bbd92b557b46ee736bfeb50a46c1a8f250e154ef7c3","observation_id":"721520c4-c719-475d-9685-3c36740ee176","resolution":{"observed_at":"2026-08-04T11:29:31.132461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:31.196577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.196577Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:96da356f2abf28a8dead92b75d42fd9d8bc0736782e43f8cc022d6db8ae58388","observation_id":"60724a84-ac48-432f-8aa8-d76d4d74f85b","resolution":{"observed_at":"2026-08-04T11:29:31.196577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03495","last_updated":"2024-07-03T20:51:41Z","snapshot_observed_at":"2026-07-06T18:41:13.986887Z","submitted_at":"2024-07-03T20:51:41Z","title":"Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03495","snapshot_observed_at":"2026-08-04T11:29:31.322714Z","title":"R.; Juki \\'c , A.; Langman, R.; Balam, J.; and Ginsburg, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.322714Z"},"links":{"cited_paper":"/paper/2407.03495","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:34c4c961b647aa12ff2060af8c3aff9e92d1d193fcfa5eea8bcec8cb586146c3","observation_id":"e29b90aa-f9d3-471a-b68d-20275a3b971b","resolution":{"observed_at":"2026-08-04T11:29:31.322714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-04T11:29:31.474390Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.474390Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:c2f59b660dbcc0b6f1c56035b15836febb3b15e59f43bc0043a3bdb202867325","observation_id":"0e0912cc-2990-488a-a4b5-b18f5fb2bda8","resolution":{"observed_at":"2026-08-04T11:29:31.474390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-04T11:29:31.571249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.571249Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:e70a640ae77e59423ae9f06b009cdc611d27b8cb12bf9112f02a44a8cb2337ba","observation_id":"16ccd22c-94b2-4b0e-b467-4436db4b9cf0","resolution":{"observed_at":"2026-08-04T11:29:31.571249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-04T11:29:31.705443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.705443Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:696c0e3fbb387a80e9e0b4bb5461608d55c7fb90b99295e8c99521daf8cf6f81","observation_id":"e3c490bd-0831-4eb7-b0f5-b81e63db752d","resolution":{"observed_at":"2026-08-04T11:29:31.705443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-04T11:29:31.898662Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.898662Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:b6f828754a4b4a1e72493199609f2036a0e38cbc5800d8947b65877706356a22","observation_id":"c517b810-88e0-407e-b179-ac0b573fca67","resolution":{"observed_at":"2026-08-04T11:29:31.898662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-04T11:29:31.996283Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.996283Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:7656517a4b957866986961527c2ad786a12229637c74a4ec3cd18b4a6579cdbd","observation_id":"6dc1f721-c254-40e8-bbb1-550d02063719","resolution":{"observed_at":"2026-08-04T11:29:31.996283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:32.118457Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.118457Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:11bde97f7067888456bb2ff137d54af67abef233ca7f176982345cb932053473","observation_id":"05ff4adb-62b4-4ea1-81ae-d5a2893e713f","resolution":{"observed_at":"2026-08-04T11:29:32.118457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:32.222197Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.222197Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:f4aadc3f8899dfa885381490a80c7acf21151b09cb0d3ced584c547d184c81f4","observation_id":"8766751d-7fdd-461c-b2cb-2ca38762749b","resolution":{"observed_at":"2026-08-04T11:29:32.222197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:32.338248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.338248Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:06f992408d7e98634c03d2cea1371efc691e28450bf77ec61b001fc72038c16d","observation_id":"bb09c3f4-f52a-4607-b5d4-37f811f7243b","resolution":{"observed_at":"2026-08-04T11:29:32.338248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-04T11:29:32.431418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.431418Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:744f1a1bfc89353f9e273508a4ab48948eadba02a311843c2ff566bcda5899d4","observation_id":"e26d98a2-a154-49b9-9b21-89d5298ec760","resolution":{"observed_at":"2026-08-04T11:29:32.431418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:32.540104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.540104Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:e5df70407ec321aa57de3e33befdcfcfc61a776dbb62aaae5908e52bb86fc649","observation_id":"9aecc85a-55cb-424f-b3e8-f2e9e24b0887","resolution":{"observed_at":"2026-08-04T11:29:32.540104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T11:29:32.656117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.656117Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:1a35c8097aaa0291f298a73d66500cc587f9f2a9951bc206cb1f9677be17f992","observation_id":"67778385-97e8-4920-b666-a32c0c30aee5","resolution":{"observed_at":"2026-08-04T11:29:32.656117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:32.767944Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.767944Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:51506d98d074a8ec05607574f36c4f4318f7eac855294493d22ba076f63dc144","observation_id":"f3acd8b4-2027-457e-9e0f-24bc337b7baf","resolution":{"observed_at":"2026-08-04T11:29:32.767944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:32.871599Z","title":"H.; Lakhotia, K.; Salakhutdinov, R.; and Mohamed, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.871599Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:b38a138d61a1ca544094d166b33d97939a7ecdcf66560093c57476037d094c0d","observation_id":"735d6574-8dc5-446b-828b-1729141b3a67","resolution":{"observed_at":"2026-08-04T11:29:32.871599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-06T20:26:07.096518Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-04T11:29:32.995304Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.995304Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:bac0992b559944f043d0728a5102f6112d4354cf34a3d11ce45d2ffa49a311ad","observation_id":"e4ed716a-13e0-4bc3-a677-661395c9a330","resolution":{"observed_at":"2026-08-04T11:29:32.995304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-04T11:29:33.186280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.186280Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:c736738f7a718efb4c35f5891c7d815edbd06383306eb095a8b7ff0b6de604ef","observation_id":"78e4abf9-eb85-44cf-9e23-1d155d9b1699","resolution":{"observed_at":"2026-08-04T11:29:33.186280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-05T18:34:08.469382Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-04T11:29:33.361117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.361117Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:99723c1dc00008677dca54e2e223d37c56624269a02e0c933a5686a80d395ee6","observation_id":"1d62f73d-0a48-4179-8bfd-70020471dff4","resolution":{"observed_at":"2026-08-04T11:29:33.361117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:33.451397Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.451397Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:e1c050df6ba426f05debbc36f67187ba990e13c2d0f04302f305d6c7a3bd6c38","observation_id":"a84a6d7e-6345-447c-8fbb-e3bf3be8fac7","resolution":{"observed_at":"2026-08-04T11:29:33.451397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:33.561535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.561535Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:7d24d906c9ec3f20cf228061b2df1465200329c97af8995b9975ca066756570f","observation_id":"d77c3ef5-4916-47f1-9dac-172eeb7c6db4","resolution":{"observed_at":"2026-08-04T11:29:33.561535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-04T11:29:33.696265Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.696265Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:38fad697c6a0f4c6ba0e074425308b8fbad0024b67aa826ac8ec2e327a7f13fc","observation_id":"373248fe-be09-4514-ab30-ec207ad538f0","resolution":{"observed_at":"2026-08-04T11:29:33.696265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-04T11:29:33.754234Z","title":"T.; Ben-Hamu, H.; Nickel, M.; and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.754234Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:f59afc84e54f62628fd97781c6066338b933b0114bede49f3a9c280a84273262","observation_id":"0013b167-b28c-4451-acaf-ce1edadd2b33","resolution":{"observed_at":"2026-08-04T11:29:33.754234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T11:29:33.883026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.883026Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:ee22a0794d3709c77f274e7eea22911d6edf7ce275355891c9ef40335c820e0c","observation_id":"9ba08cfd-6e72-4426-9c96-74149d070b56","resolution":{"observed_at":"2026-08-04T11:29:33.883026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:33.994476Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.994476Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:9080560ced22a8f15d8d8c50bc46de3b242384da714dc2310ca635dd5dd6a1c0","observation_id":"5941f89d-d6c2-4b1c-90f0-582dff6b0b01","resolution":{"observed_at":"2026-08-04T11:29:33.994476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-04T11:29:34.131364Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.131364Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:6e63eb851b692522e5070cc1a2145f4421e572d70b8f43dc93f2c11d94a44bf7","observation_id":"57f393f3-6b97-4470-8eb0-1ee4d4ea2ec9","resolution":{"observed_at":"2026-08-04T11:29:34.131364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-04T11:29:34.295228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.295228Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:de299d70fbcc7926116015246f900d84b0ea1af54e3d1abf3816edacb0be6d32","observation_id":"f0f964f5-1a8a-4393-b402-e7f00e95610b","resolution":{"observed_at":"2026-08-04T11:29:34.295228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:34.414497Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.414497Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:7063d13dccb300d94d24952ed66c6c672d0e03323d9b25b524b8dc04e292f03b","observation_id":"824117dd-ceae-4d70-8023-5e8857825b2a","resolution":{"observed_at":"2026-08-04T11:29:34.414497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-04T11:29:34.568989Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.568989Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:eeb37da58c204fe7dd4525fdaa50b6c30d15f1e9b3a30888d376bd3f988adce8","observation_id":"53c9b8f7-de86-422e-b20a-8907cae3e636","resolution":{"observed_at":"2026-08-04T11:29:34.568989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16973","last_updated":"2024-06-14T00:29:46Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:38:32Z","title":"VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16973","snapshot_observed_at":"2026-08-04T11:29:34.725106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.725106Z"},"links":{"cited_paper":"/paper/2403.16973","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:244b1fb965923983f76a570edb75a87811cd07593fc946d15b78a9dbb4524ef5","observation_id":"c3e95c70-006b-4ae0-adea-c2799aed0a28","resolution":{"observed_at":"2026-08-04T11:29:34.725106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:34.824864Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.824864Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:3522ae8bb344e106919dc6928a387e29b4a881178d5fbd6ad2875d3eede19c18","observation_id":"538ddc52-61fb-49c2-b2b9-d6b19698a0fd","resolution":{"observed_at":"2026-08-04T11:29:34.824864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:34.882310Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.882310Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:68275d897d289f68f913c3c45cfae58cbc1d3931ebf17e8091f695a65c3a6830","observation_id":"d927ba39-53d1-4da2-9d32-d96732e04cc0","resolution":{"observed_at":"2026-08-04T11:29:34.882310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:34.954596Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:34.954596Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:789f5807713cb9801b106d8f724d82e0eb0ca8968ca97a0252144e3a108c0f94","observation_id":"5e4547fd-349e-462e-a787-e147ed690b05","resolution":{"observed_at":"2026-08-04T11:29:34.954596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-04T11:29:35.013183Z","title":"K.; Asawaroengchai, C.; Nguyen, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.013183Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:dc38526c8c0511c4f00c61fec139da315427a071227b5621fe1070ff021c1033","observation_id":"b88e8dbe-4465-4fa1-adda-ea000ed42111","resolution":{"observed_at":"2026-08-04T11:29:35.013183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-04T11:29:35.095216Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.095216Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:4f9850d3202a8b577726aa9554ad94ffb3de2a11f67902b084feb8e9d222426a","observation_id":"85a00b91-637e-463e-8539-58ba0c53a2ed","resolution":{"observed_at":"2026-08-04T11:29:35.095216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-07-06T15:17:05.623407Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-04T11:29:35.214098Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.214098Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:c278c640dc156ef41afc33c25aa8b95563be967d82cffd4c6572465e2ab8d7be","observation_id":"5aa886f0-7a3f-46af-a0b0-bdfb212737bb","resolution":{"observed_at":"2026-08-04T11:29:35.214098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-04T11:29:35.347050Z","title":"P.; Kumar, A.; Ermon, S.; and Poole, B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.347050Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:b094b83a3d87b6919727ee475567feac1202a3c5d1bc50000a28612587e99d52","observation_id":"34b8e233-0184-4db3-8a07-5e5d3014c484","resolution":{"observed_at":"2026-08-04T11:29:35.347050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-04T11:29:35.497378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.497378Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:e2b2fa6c5dbce4684a01e2b4329e1d881bf775d4b7da2341faf994266c307498","observation_id":"8da660ea-1bfd-41f1-a7f3-410d61674243","resolution":{"observed_at":"2026-08-04T11:29:35.497378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-08-04T11:29:35.787283Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.787283Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:55850580233e6bb1f808a8f388471f01b9e0e173b2089a6d9ce8029655d31bdc","observation_id":"f7ac93b2-b13d-4169-bc04-40c1e4174723","resolution":{"observed_at":"2026-08-04T11:29:35.787283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T11:29:35.952638Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.952638Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:4ce7184b050d2d855a60ea317e0520a3d17311f5266d19dedc7774833e34ee0f","observation_id":"f1829538-7131-4a4e-aa04-77826f46978f","resolution":{"observed_at":"2026-08-04T11:29:35.952638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T11:29:36.075318Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.075318Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:b83070a16c01c1869d20f9fbd3a18b973a2db4ecdc3a42a0667d4c77899b3fa5","observation_id":"2b3821e8-c4cb-4589-b362-5bfc4485c04c","resolution":{"observed_at":"2026-08-04T11:29:36.075318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24291","last_updated":"2025-05-30T07:04:23Z","snapshot_observed_at":"2026-07-06T21:33:31.469620Z","submitted_at":"2025-05-30T07:04:23Z","title":"Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24291","snapshot_observed_at":"2026-08-04T11:29:36.222695Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.222695Z"},"links":{"cited_paper":"/paper/2505.24291","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:4fe91a2401e3b5c4ba258b8513757812d2ad7c788c43bc92c268e148f3e0637c","observation_id":"a9dd9d83-9aca-4892-bfef-27d9cf13f29b","resolution":{"observed_at":"2026-08-04T11:29:36.222695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:36.344998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.344998Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:d517b19829244ba29e1ef625561fb1e3297af9b7cd43b91c9eea28565938efe0","observation_id":"71e575a4-b2e1-4939-861f-3529f1edb453","resolution":{"observed_at":"2026-08-04T11:29:36.344998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-04T11:29:36.515375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.515375Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:33944fe45068cfac5e3d1c3b8ba9a6e0d45387b5e60a0c5a19b8a9d9b4f7697c","observation_id":"06f231c7-7dd5-4e17-92c0-188fee700bf8","resolution":{"observed_at":"2026-08-04T11:29:36.515375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-04T11:29:36.628124Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.628124Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:37b254e7a7574bcccd94d19744b8e71aa6daccf24aa6ed604c2e19730a16691d","observation_id":"f634f89e-bfc2-4b66-8aa0-d610f9a94a59","resolution":{"observed_at":"2026-08-04T11:29:36.628124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-04T11:29:36.756155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.756155Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:7fc1882350907ceda90a05415f30f09036bcde99360075cff5864c8029bec4ba","observation_id":"322652e2-702e-4bb2-9f40-afbf0934ccc1","resolution":{"observed_at":"2026-08-04T11:29:36.756155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T11:29:36.870189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.870189Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:c32d998440267e927843956555e1e1a61f75b787b03efdee3e7b72848b2f7f69","observation_id":"a6ccd059-323c-4831-b26c-401f61f95b9c","resolution":{"observed_at":"2026-08-04T11:29:36.870189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-04T11:29:37.020821Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.020821Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:7f2f84f7ba2cb9da51ad88265c34179c66f24b67cbd2937bc6af9795abbfe54f","observation_id":"c6f16ced-7f86-4346-bbcb-62104c5b69fa","resolution":{"observed_at":"2026-08-04T11:29:37.020821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:37.202373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.202373Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:a390119888e48cf24964b456f7dda6e71a25c40c1fd41e515cb3baf7366ef2b2","observation_id":"5393d5e1-bc22-4581-a2f1-2f55b9d50dc0","resolution":{"observed_at":"2026-08-04T11:29:37.202373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-04T11:29:37.345020Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.345020Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:045b662611ae19d9a8ef3471be0f92be989ac18a5f25a7a3db7d8d1519b87f1e","observation_id":"a5daa850-7551-4dda-bb63-e5d0f2544a90","resolution":{"observed_at":"2026-08-04T11:29:37.345020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:37.454875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.454875Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:575e201af681c8ac1dfcc92feea2764e61400ac89abe6a0ebd5071942e700ed4","observation_id":"115c5972-fd02-4904-bdad-7c607d74e07a","resolution":{"observed_at":"2026-08-04T11:29:37.454875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:29:37.539911Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.539911Z"},"links":{"citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:2c3c7ab9864ad4abc3b47dccd91ccc13bc56ec5fc5cee3b7e32bf0c62505e463","observation_id":"13a75cfc-a4ff-423f-baa5-31946f54146a","resolution":{"observed_at":"2026-08-04T11:29:37.539911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T05:42:33.160275Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-04T11:29:37.658307Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.658307Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:aad6e341c346faf0b1f38a052e8b06e4775add8c546747054d5eafed2c75139c","observation_id":"47b089b6-57a7-46ab-8b68-20eebafca2cd","resolution":{"observed_at":"2026-08-04T11:29:37.658307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-04T11:29:37.769261Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.769261Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:1ccc24f8ab0dcf47c5936a69656c183679646e1563742e0d6050844ec4321365","observation_id":"5cd6c1fe-12f6-46d5-9058-6cbcc06f8e41","resolution":{"observed_at":"2026-08-04T11:29:37.769261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2510.04593."}