{"as_of":"2026-08-07T21:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa9ea9ea335d72fbd8495af30cf9d400736a80f606686c530632b06e0d35bee3","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T12:26:37.300599Z","state":"measured"},{"denominator":145,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":145,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":131,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:15.641196Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2409.18512","last_updated":"2026-04-03T15:54:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T07:46:52Z","title":"Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T20:31:24.494060Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2409.18512"},"observation_digest":"sha256:2674d54274d2fc047a4576a2ad7cb48ff7c8c6d5f3d15156cb7272aeccd51315","observation_id":"041024c9-5f47-488e-9eb4-24126add3958","resolution":{"observed_at":"2026-05-23T20:33:25.586949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:46d8f2926295bc8559a93d36619b4a52392a27a52d62748a50f06f7ad760b654","observation_id":"6000b29f-4584-435c-9497-184926710ea2","resolution":{"observed_at":"2026-05-16T06:06:41.513885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T06:19:09.507440Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2412.10117"},"observation_digest":"sha256:e8a3e614561a0e52f135d6373852fe08c3d11f0b63e8b067bbdf6142ed54742d","observation_id":"2287c955-3603-42e4-99a2-762e4db69d33","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:e50b2ce4ef38d619f7cfd5ca12853cad746768765c83e25aa96cbccc88ed9acf","observation_id":"0024d1c8-e6d0-4bcc-9ca5-e0bd5e3fc405","resolution":{"observed_at":"2026-05-18T13:39:48.408958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:55c68fc1eb1ceb841e4b5101e37f7aa4e868b1ccf40104d6fba667e184dd9b7d","observation_id":"e91e50a7-28a0-41b1-a4ec-af7cc51c30ab","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2505.14066","last_updated":"2026-05-17T00:36:59Z","snapshot_observed_at":"2026-08-04T01:17:33.464668Z","submitted_at":"2025-05-20T08:12:12Z","title":"SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T14:53:09.885971Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.14066"},"observation_digest":"sha256:d46494dbf7812a04f15354485db678ef7260ed3e31ce7e6bd540b7474f2fcee9","observation_id":"66210f73-2ac1-4062-9482-daa2511608c5","resolution":{"observed_at":"2026-05-22T14:54:54.683917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T15:23:15.641196Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T15:16:26.047622Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.641196Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:9884a58b4b189b21a413d98651224cf71e86cf04d5f8e7135e7daae48627f999","observation_id":"ca8bfa3e-ec9a-44ad-b667-1584f0572553","resolution":{"observed_at":"2026-08-07T15:23:15.641196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:53:14.619002Z","title":"Seed-tts: A fami ly of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-07T14:59:34.154366Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.619002Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:b66fe4f39345eadf35e5e4bcb3246cc54299ae850d9babbdd807d90460752d78","observation_id":"9d33002b-6b3c-47b2-89c1-3fcdaa12fcef","resolution":{"observed_at":"2026-08-07T14:53:14.619002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:6cd1f09af7415d2c92e5a19a24d9ff98077cfad8c8080b481705911894599511","observation_id":"c0938d39-b2e4-4570-afee-d5c45c76504f","resolution":{"observed_at":"2026-05-16T05:27:25.538207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:19:57.780080Z","title":"Seed-tts: A family of high-quality versatile speech generation models.ArXiv, abs/2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.780080Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b979749bae24b029ac473625a211462cb873f72a90aa9a522445e64d1916d0bc","observation_id":"8d541a03-a710-477c-a4db-f2ce42905748","resolution":{"observed_at":"2026-08-07T14:19:57.780080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:15:53.546922Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.546922Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:24270923d173580aa8325afe4731f974d12c8adf77c2b96053e863147cd15dc5","observation_id":"1d4d6018-6c07-457a-8bcd-920d8e4b9f3c","resolution":{"observed_at":"2026-08-07T14:15:53.546922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:09:18.881600Z","title":"Seed-TTS: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.881600Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:07eaa48ca05f7a89e05514e9f45302f7bf3fe619c12dff846775072b15179802","observation_id":"8d788c02-3a57-4d3a-9989-b5a4490215d9","resolution":{"observed_at":"2026-08-07T14:09:18.881600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T13:54:23.772789Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20693","last_updated":"2025-05-27T04:02:01Z","snapshot_observed_at":"2026-08-07T13:46:35.735260Z","submitted_at":"2025-05-27T04:02:01Z","title":"Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:23.772789Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.20693"},"observation_digest":"sha256:0b4b2d26a34649b4a5f39954b4447b7db156949f702636497b089decfc45800b","observation_id":"061b2b2b-82f4-4c5a-84d2-8a4e4e9d4b26","resolution":{"observed_at":"2026-08-07T13:54:23.772789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T12:12:27.861952Z","title":"Seed-TTS: A family of high-quality versatile speech generation models.arXiv preprint arXiv:2406.02430,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00385","last_updated":"2025-05-31T04:31:02Z","snapshot_observed_at":"2026-08-07T12:04:30.289730Z","submitted_at":"2025-05-31T04:31:02Z","title":"MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:27.861952Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.00385"},"observation_digest":"sha256:918ed4b9e75e4f50b42372a1e2cf6bce1210f9b2550f69ba48abc2323d04dbc3","observation_id":"914a2250-af2d-4a02-841e-30a570b8fdb0","resolution":{"observed_at":"2026-08-07T12:12:27.861952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T11:58:32.751404Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T11:51:24.570828Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:32.751404Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:6e4a7d35ea2636214e5516e2136bff51f4b037bdd1a5d22ec5f8967e7b9679a3","observation_id":"6c068f11-9a6e-4a59-b3d1-ebd2798c923b","resolution":{"observed_at":"2026-08-07T11:58:32.751404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T11:37:29.364137Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01934","last_updated":"2025-06-02T17:53:10Z","snapshot_observed_at":"2026-08-07T12:27:48.889414Z","submitted_at":"2025-06-02T17:53:10Z","title":"RoboEgo System Card: An Omnimodal Model with Native Full Duplexity","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:29.364137Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.01934"},"observation_digest":"sha256:b300c509476b920e16b6da6772295c1e247821f8a8c995081ed1dfa27e007be8","observation_id":"bd8141c1-7133-4193-a7d0-aac7c6faba2a","resolution":{"observed_at":"2026-08-07T11:37:29.364137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T04:58:06.798089Z","title":"Seed-tts: A family of high-quality versatile speech generation models.CoRR, abs/2406.02430,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-07T12:51:38.948660Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:06.798089Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:abefabfab6092af9e2b11083fb5f0e9ee9a206815387c26fb87951674936f785","observation_id":"97c7ba52-f118-4652-bb40-c2f3d27a5a33","resolution":{"observed_at":"2026-08-07T04:58:06.798089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T10:17:43.623663Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-07T20:45:05.929732Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:43.623663Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:f90d3c95477c75e93f986443478d8f8f7d36de3c8f5958712df49b9c3f35ca69","observation_id":"42ac2bef-7eda-46a8-93e0-beeed2e49c55","resolution":{"observed_at":"2026-08-07T10:17:43.623663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T00:45:13.675822Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13053","last_updated":"2025-08-07T03:12:26Z","snapshot_observed_at":"2026-08-07T04:01:53.597585Z","submitted_at":"2025-06-16T02:48:17Z","title":"ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:13.675822Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.13053"},"observation_digest":"sha256:8b938ccd30c4510e2c498ba1113143d2fbea9fa3124031e237e6efcfb3a2fcda","observation_id":"811b01f7-0773-4610-a07c-7bf31ea74375","resolution":{"observed_at":"2026-08-07T00:45:13.675822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T23:48:43.838451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16010","last_updated":"2025-06-19T04:06:43Z","snapshot_observed_at":"2026-08-07T10:47:01.307481Z","submitted_at":"2025-06-19T04:06:43Z","title":"SimuPanel: A Novel Immersive Multi-Agent System to Simulate Interactive Expert Panel Discussion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.838451Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.16010"},"observation_digest":"sha256:2248faabd9b2853f7eb15ae18e172b40d1d4e170ee888c38ab76441dc4eb9053","observation_id":"d0d2d73e-b959-474c-abb0-a24333169bfc","resolution":{"observed_at":"2026-08-06T23:48:43.838451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T23:21:51.474748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.474748Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:f0e0baf1064d18ebdd8b189087cf89c7d1e44f77b326b68e14637174c2b185c2","observation_id":"ba6482a5-3d62-479f-b595-93150211c630","resolution":{"observed_at":"2026-08-06T23:21:51.474748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T22:19:00.703156Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22023","last_updated":"2025-06-27T08:45:21Z","snapshot_observed_at":"2026-08-07T19:17:21.433342Z","submitted_at":"2025-06-27T08:45:21Z","title":"Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:19:00.703156Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.22023"},"observation_digest":"sha256:31184f6af5c16a4a27b706253c95a8755288795a41fce18767efa4fe7a20d44f","observation_id":"3fff0af9-2b2b-4938-aa93-41cff71acb69","resolution":{"observed_at":"2026-08-06T22:19:00.703156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T19:21:03.946996Z","title":"Seed- TTS: A Family of High-Quality Versatile Speech Generation Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.946996Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:870cf86bab53ee5827d23d35950499eb765434b264ff276cdc1e51fbdcbc0fcb","observation_id":"0b63ce8a-c9bf-4023-b1e3-db6397667678","resolution":{"observed_at":"2026-08-06T19:21:03.946996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:be0c3254a9779f5f90630de0a70aa4504d463d9914fe1c143c48de2c6170fc00","observation_id":"ae0691d8-4a74-473f-aada-22d1c6418655","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-02T11:31:42.381498Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T04:29:41.285194Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.09318"},"observation_digest":"sha256:c47e58b2325ecf52c87ed94580f08ef9dd80a1426b085cef982d3ad04e8786c2","observation_id":"c215fa50-64f0-4d60-b724-468a474cd059","resolution":{"observed_at":"2026-05-19T04:32:03.700577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T16:55:49.452658Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-07T14:59:35.759272Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.452658Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:f29d30226e48e4ab74ba5a4e4d02f32d7fbd628218a7a1e38e2230970e6ee165","observation_id":"971e9b2c-bccb-40d3-ac1b-bd6a2a5cb146","resolution":{"observed_at":"2026-08-06T16:55:49.452658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T15:48:22.884960Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-06T20:34:40.446355Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.884960Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:eac1d267963c864bd726843053021d3b9084941896a3c0994190a3340cb16854","observation_id":"49409248-3195-4e3d-b17a-5e25c7bb2263","resolution":{"observed_at":"2026-08-06T15:48:22.884960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:2c7a317a3f811f40e33447dbc19590317050e1e245a822ce1f0023098d8d0e80","observation_id":"f313ab2b-dc9a-4109-a0a2-f5ea84ba8cf5","resolution":{"observed_at":"2026-05-16T05:59:51.008000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T15:07:26.599209Z","title":"Seed-tts: A family of high-quality versatile speech generation models.arXiv preprint arXiv:2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16884","last_updated":"2025-07-22T16:26:58Z","snapshot_observed_at":"2026-08-06T16:54:35.498677Z","submitted_at":"2025-07-22T16:26:58Z","title":"SplitMeanFlow: Interval Splitting Consistency in Few-Step Generative Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:26.599209Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.16884"},"observation_digest":"sha256:7a1fb55d0a05aec82545b46b6efffaa4cba20924bf79a16bde79fcd5eb4aae07","observation_id":"e0ae2f24-26f0-4756-b95f-8a1031fa1b01","resolution":{"observed_at":"2026-08-06T15:07:26.599209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T14:52:42.942516Z","title":"Seed-tts: A family of high-quality versatile speech generation models.arXiv preprint arXiv:2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17527","last_updated":"2025-07-27T05:17:25Z","snapshot_observed_at":"2026-08-06T19:59:57.844828Z","submitted_at":"2025-07-23T14:07:41Z","title":"Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:52:42.942516Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.17527"},"observation_digest":"sha256:2e60b6c8415af3d5cfaf81bb7443160dbbc3a8e9b0402187c678da2531a279f4","observation_id":"b4245843-32f7-45af-b82e-a5839e43af1a","resolution":{"observed_at":"2026-08-06T14:52:42.942516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T14:50:04.208123Z","title":"ArXiv abs/2406.02430 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.208123Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:9ca6079513040596df6bda7c5fb2456b8edc556218417ec3fbae344a512b3972","observation_id":"be7f1afa-59f8-436c-94e5-b0b99ba1b117","resolution":{"observed_at":"2026-08-06T14:50:04.208123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T15:02:02.897698Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-07T14:59:33.170172Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.897698Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:46689f4aac1dd2fccd0ccfb489563dfd1849ba74feeeb881d706c7b8f048ed61","observation_id":"aed9d272-a437-42ff-bec8-c77046dd3603","resolution":{"observed_at":"2026-08-06T15:02:02.897698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T11:34:08.681690Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-06T18:06:32.518742Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.681690Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:b8982d0ab953770006ed3fcb8f436fa35fca55a4ab703de7352a18ac7474c61a","observation_id":"368df377-e60e-4603-b996-af6b64354af5","resolution":{"observed_at":"2026-08-06T11:34:08.681690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T06:04:29.065491Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T20:34:36.422314Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.065491Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:33a3a55bb9bb6fe1f4e96b0f400add8d12a8c4068c702a469f9078fc3cda3731","observation_id":"c770a0db-f760-470e-a2bc-9da33e913861","resolution":{"observed_at":"2026-08-06T06:04:29.065491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T23:43:03.170323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:03.170323Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:775ea92049c3b3eec8653af8e18a9c4dea4d202b230e0c2ac5f0ff7822614672","observation_id":"54bdc28c-fedc-4056-8ee1-8e20b8959378","resolution":{"observed_at":"2026-08-05T23:43:03.170323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T20:04:50.143999Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.143999Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:7e7d00e936c43654350062d69fb789ddcdec0782988614dbf41b3ce5847cfa35","observation_id":"653e739d-550c-4d36-abff-8a836d6e1634","resolution":{"observed_at":"2026-08-05T20:04:50.143999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T18:39:27.824911Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14395","last_updated":"2025-08-20T03:45:18Z","snapshot_observed_at":"2026-08-05T18:39:25.569218Z","submitted_at":"2025-08-20T03:45:18Z","title":"NoteIt: A System Converting Instructional Videos to Interactable Notes Through Multimodal Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T18:39:27.824911Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.14395"},"observation_digest":"sha256:9143d35a1fc8f9ec85e3b8a2e66f9cc32d33ee0ed79ddc1e4131300badaf5917","observation_id":"65d4b235-9ce0-4f6d-bdf3-10d2af920dff","resolution":{"observed_at":"2026-08-05T18:39:27.824911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T16:01:52.500071Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.500071Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a5f5256b5a21624b784c8f800aa872767787e04a4aa639a71ade7feea487ab8b","observation_id":"958bcb74-b0d2-4b6d-b750-76a12a654377","resolution":{"observed_at":"2026-08-05T16:01:52.500071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T13:24:34.204193Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.204193Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:52e16aa106ade5b888f8945a86869c1e699c6b78617a80acb6d4f3ed5a5a3605","observation_id":"f8d55cdd-b927-4d12-b893-ac9fee5a77e7","resolution":{"observed_at":"2026-08-05T13:24:34.204193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T12:00:45.422814Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.422814Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:921b9e41bda288c91f00c64e5551f5c3cc90bbd6aa3b5f771ed468d57469bde4","observation_id":"78740931-f52f-485a-baba-662d9142bc05","resolution":{"observed_at":"2026-08-05T12:00:45.422814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-04T19:11:59.476799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09748","last_updated":"2025-09-11T12:32:08Z","snapshot_observed_at":"2026-08-06T08:55:28.245549Z","submitted_at":"2025-09-11T12:32:08Z","title":"DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T19:11:59.476799Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.09748"},"observation_digest":"sha256:314fbf0a23c4c06ce2e37dbb788e59c5fa9529f8b47238f031bb026c14c45829","observation_id":"413d3af7-a553-4508-a4ab-f335efe03ca0","resolution":{"observed_at":"2026-08-04T19:11:59.476799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T00:20:37.406351Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.17765"},"observation_digest":"sha256:416bfe2c4b67b4127edb19bb3dffb51cdd9bf10aad15594b95631a0e26150813","observation_id":"127fb2f9-b8ac-4151-a00b-fa8dde61b793","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:23d67fc6cabfbe147b9f5a7f26fa3a576006fb1c3f8437844cfc2b97657fc8bc","observation_id":"d7bd7831-89ca-4f66-824a-53913e906523","resolution":{"observed_at":"2026-05-18T13:01:24.425634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:6f5dac89fb0a45d59cd1be5752e4efdd917e2eb9889191d49dedf539b5f06822","observation_id":"a9d33b68-1469-43b4-b45e-0df35f32b1cc","resolution":{"observed_at":"2026-05-17T01:03:15.285620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-04T11:29:29.658196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:29.658196Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:6561ad8cea5c1341d4582c83f88179a26ea65df286642c5e9bc49b372712072b","observation_id":"ad9c0fc2-96f3-42d0-8681-5988cbee1899","resolution":{"observed_at":"2026-08-04T11:29:29.658196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:f19ba4be8420b00d31d37a0edbee0bba52fed1c232d3b3cd7b1970023bb78f47","observation_id":"3ad9b056-fa54-43bd-9269-f8e379043065","resolution":{"observed_at":"2026-05-21T18:20:29.267476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:d5b86d334ba2531282ac79fdf63a7bc34a95f8f9b40b077e130bebe025cc3c46","observation_id":"4e4ec9b8-24c5-477d-98a4-25da48619be5","resolution":{"observed_at":"2026-05-16T19:24:56.112886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-03T06:03:34.891329Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.00560","last_updated":"2026-06-10T10:57:05Z","snapshot_observed_at":"2026-08-07T06:26:40.381217Z","submitted_at":"2026-01-31T06:56:50Z","title":"Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T06:03:34.891329Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2602.00560"},"observation_digest":"sha256:601ec2927850d6bf858d8b27b06753ac1725e64b05e4c7c6caa404f5a92da215","observation_id":"762d14bd-1ad1-4767-9a1c-6ca2513c7d76","resolution":{"observed_at":"2026-08-03T06:03:34.891329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:515afb4f2f875a1e4d8a7604de57ed81fe102dbdfb8857d23fb1987623fea05e","observation_id":"2e099125-5d51-42d8-9179-f8b163ee6863","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:308e3841359f4e67c97e6eecad70d5deaea38daf6968d8f04936ced3fa88af7a","observation_id":"ddf0ac01-a325-4c9b-bd3d-9f2f54c30453","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:beb12684c8ed4f7ae1da6363e65c9e1d141f8b89724e1330ef5290a0bd66af2e","observation_id":"344fe637-5357-4c17-9763-3bb213d23851","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:181a495ac4e39218b972d5cf46192165391d4ef9d21bc0b153e5c28e468c0b35","observation_id":"5923032c-c62d-4621-90d4-f0fac40f1c00","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.08558","last_updated":"2026-06-23T07:14:55Z","snapshot_observed_at":"2026-07-13T23:53:49.367849Z","submitted_at":"2026-03-17T07:35:28Z","title":"WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T10:29:51.313835Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.08558"},"observation_digest":"sha256:44405a7db9af02e86d2b0d06ff385ceb7a3e8d34619716175013fa8d73dce923","observation_id":"93d3680e-622e-4165-aa15-bb465142f1f3","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:04a6f692068c4c700c10905088ac1e599d02c61dbb71769221e1140003822f3e","observation_id":"b45ebf96-f36d-4ff1-8d55-f2885248ae0b","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ede6e156dd64197246e0409dc3111fda57eb1e0315badc69ba09a968708be804","observation_id":"a6a1f961-7ef8-4cc2-ac74-94e3e8085089","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.11424","last_updated":"2026-04-13T13:06:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T13:06:09Z","title":"Bridging What the Model Thinks and How It Speaks: Self-Aware Speech Language Models for Expressive Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:10.832592Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.11424"},"observation_digest":"sha256:3c9049e95c61e8df75cd16d79364be910c16f04875ca2c97a32fe5b915a25497","observation_id":"368dbd12-4a7c-4adc-85a2-480ae8d16224","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:478c109060db1206a2792f8404fbac2ccf782c6a0f37c6aa0deafc03e5ac4524","observation_id":"0babbef2-c98d-4d4c-b65d-27c612265560","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.15037","last_updated":"2026-05-02T12:33:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T14:06:30Z","title":"From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T11:44:12.373082Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.15037"},"observation_digest":"sha256:e47a430c5205ea9476005ef95c6c71af266827fa4dfc793464f5224f3875f76b","observation_id":"0f264bc0-690c-42dc-bfd4-a656e57854fb","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T08:11:22.402552Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.15804"},"observation_digest":"sha256:530926c3ade78f871a87be8d281f5d151b65e7c8333bb2c290178ea1bcf44c92","observation_id":"5cd30102-480c-45e5-8003-39ec429f79ef","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.17958","last_updated":"2026-04-20T08:39:55Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:39:55Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T04:03:38.919545Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.17958"},"observation_digest":"sha256:aa46661085b6d9dd5277fa57a99fdcafec1bf878352fe46f1c598de51361a987","observation_id":"b3ef62b0-6daf-46df-a116-19ff86208f6b","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.19330","last_updated":"2026-04-29T12:12:36Z","snapshot_observed_at":"2026-08-03T01:33:20.785741Z","submitted_at":"2026-04-21T10:58:48Z","title":"Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T01:01:06.094276Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.19330"},"observation_digest":"sha256:ee31af7855c827c93d33bd13442f4fa7f58e0f0cccf601f5876c4f36fc5cc42d","observation_id":"bc83a086-21fb-4ef8-b518-a539e471edfb","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:09.008954Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.19679"},"observation_digest":"sha256:403705f5907cea9511bd3f2f7c1b156bafb13bb8461ceb4148b19ac02dc40b6a","observation_id":"1d6cf6c1-a7ea-4697-acb7-4c5191f789ed","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.27607","last_updated":"2026-05-07T10:41:55Z","snapshot_observed_at":"2026-08-04T02:43:28.238788Z","submitted_at":"2026-04-30T08:59:03Z","title":"JaiTTS: A Thai Voice Cloning Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-07T06:34:45.357695Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.27607"},"observation_digest":"sha256:55572feefb7d75c3244e901e8f39f5731ff797f916285558575f8bb3cda05e7a","observation_id":"973c30f0-f12b-4bdd-b61f-d359795cec47","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.27607","last_updated":"2026-05-07T10:41:55Z","snapshot_observed_at":"2026-08-04T02:43:28.238788Z","submitted_at":"2026-04-30T08:59:03Z","title":"JaiTTS: A Thai Voice Cloning Model","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T03:09:24.541657Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.27607"},"observation_digest":"sha256:d62e7416b89b72c5d0905d0b2ece5ad2b2825df71d83151757a7413ccf723611","observation_id":"f7a73220-847e-4795-90c8-943f60284c24","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.09386","last_updated":"2026-05-10T07:24:55Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:24:55Z","title":"Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T03:04:44.050889Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.09386"},"observation_digest":"sha256:f3e9113485a090aca91dad8033976ad272d22690e24f30ff03125a4565919c92","observation_id":"92f9b56f-4056-4c15-a7a8-528731586257","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.15984","last_updated":"2026-05-15T14:17:19Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:17:19Z","title":"Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-19T18:36:34.351533Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.15984"},"observation_digest":"sha256:591b64764df45d12e3654fe5406d26902128bbc5bb8ce26c42bc26a0600bd37b","observation_id":"beb68d03-d8a0-4a6b-83c4-21e8f1661d43","resolution":{"observed_at":"2026-05-19T18:37:42.783936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.16964","last_updated":"2026-05-16T12:37:06Z","snapshot_observed_at":"2026-08-02T05:10:05.598125Z","submitted_at":"2026-05-16T12:37:06Z","title":"SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T18:58:15.288299Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.16964"},"observation_digest":"sha256:49c08ed38a14483382dc2bc12a8d64868dddee42edfe2a3cebfe3ada87827d52","observation_id":"6c05834e-168f-4850-8991-eee0d38ab236","resolution":{"observed_at":"2026-05-19T19:02:43.586091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:b75bd4731c5739bcd95ce69538064c9b2bcbdb24902148f6cb6277693f080f03","observation_id":"59e97aa2-3ac4-4d1f-b1a7-bde25cad6181","resolution":{"observed_at":"2026-05-20T14:53:23.190532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.20830","last_updated":"2026-05-20T07:21:36Z","snapshot_observed_at":"2026-08-02T05:58:18.404966Z","submitted_at":"2026-05-20T07:21:36Z","title":"Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T02:32:26.122526Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.20830"},"observation_digest":"sha256:17ee29357a09d8bcdf51cae5a43f3660e56df35b354e2db126076842596e43cb","observation_id":"52ccb11b-2904-498b-b600-24adc1f572da","resolution":{"observed_at":"2026-05-21T02:33:55.429131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T02:56:06.910758Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:32502ad0d045a893767c7f6d003ed0a9248f980d1b1ba79f91846bdd7a6db9fb","observation_id":"283516ce-deb9-4eb0-92d9-253a24097c53","resolution":{"observed_at":"2026-05-22T03:00:58.966721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-02T13:29:53.155695Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T13:29:53.155695Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:4f14343950272f4b1514535ba061cdc763d00d2308a1b5aa0a869ba9f24ade22","observation_id":"205d5100-80f6-4707-acfb-43c77163227e","resolution":{"observed_at":"2026-08-02T13:29:53.155695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-07-13T08:22:44.347941Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23912","last_updated":"2026-04-08T23:43:46Z","snapshot_observed_at":"2026-08-03T04:32:52.637811Z","submitted_at":"2026-04-08T23:43:46Z","title":"Raon-Speech Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T08:22:44.347941Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.23912"},"observation_digest":"sha256:d35d4a3671be1c61522cab1d1ba869373c2b1bcb421bc8884c16fbffb7de2f05","observation_id":"3db25c6d-0be8-49f4-a71a-530a3de1d0b9","resolution":{"observed_at":"2026-07-13T08:22:44.347941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-08-06T13:26:23.950630Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:85ea6ee89656e928e96da3d33cbefdd55e234649204f871efe7f19fb8489a9ac","observation_id":"a795d270-d0da-4fde-a878-3e70b2b63207","resolution":{"observed_at":"2026-06-29T16:23:39.877202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.30073","last_updated":"2026-05-28T15:21:45Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:21:45Z","title":"Native Audio-Visual Alignment for Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T07:53:59.795431Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.30073"},"observation_digest":"sha256:6f1cccee708aab23766787d895acb1d1cad600a7d6de7740c8c13f01d1703b32","observation_id":"e85a2a67-8566-44eb-ba9a-0b7ffd97609e","resolution":{"observed_at":"2026-06-29T08:03:14.765078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:e39d4f75969465fe5e2adad6f0e09a3a994be198b8547ab81b271c6c1391df24","observation_id":"d2dc4718-1a32-4d2a-952e-3628a94ac764","resolution":{"observed_at":"2026-07-01T20:26:13.135594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-04T13:05:35.009507Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:aa8c12686881f40e6d74e1f7d22406ef558b248b8bbcc85b909482cc6c517283","observation_id":"cfd54f65-456c-433f-bae3-90776aa463a9","resolution":{"observed_at":"2026-06-28T20:52:37.897010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.00507","last_updated":"2026-05-30T03:44:12Z","snapshot_observed_at":"2026-08-02T14:23:14.310102Z","submitted_at":"2026-05-30T03:44:12Z","title":"LaSR: Context-Aware Speech Recognition via Latent Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T19:12:59.843096Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.00507"},"observation_digest":"sha256:0ee469cf5274a59fa922f6ca257d0842a015a170fe1b2d2ea0e9abb89172aa4c","observation_id":"27dcc097-dae4-42d1-b873-027a5d2b0953","resolution":{"observed_at":"2026-06-28T19:22:34.997415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:94fe0bbcadf8a32c4346d1bc664dd10593844705577efb044e2cd5b3262547bc","observation_id":"791d3621-378a-4a24-b29b-8342366a8cc7","resolution":{"observed_at":"2026-06-28T17:52:27.089254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:bab5749d66bb83d90ba30e9f32beacac63213b0f852e2e5142d408f8d858b9c1","observation_id":"d81efb37-1666-4930-9056-de1de2e10669","resolution":{"observed_at":"2026-07-02T00:46:24.621193Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.02739","last_updated":"2026-06-01T18:05:18Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T18:05:18Z","title":"EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T12:34:06.024192Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.02739"},"observation_digest":"sha256:4c5ec68adb2cda94aeaa5747d68dea3bd6fb67b38ea0a3e3ab46c8148156c22b","observation_id":"697c4449-917b-41c8-bb3a-db42a690e70d","resolution":{"observed_at":"2026-06-28T12:42:08.977406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:ed418b6a0eb4a96259881bb4159ed82aa3e11f25750f1b26c360ebccc1e8469b","observation_id":"2ce5ec35-c2ca-49f5-a2e9-a3785716a6e5","resolution":{"observed_at":"2026-07-02T05:16:39.811706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.03672","last_updated":"2026-06-02T13:56:31Z","snapshot_observed_at":"2026-08-06T22:12:01.138053Z","submitted_at":"2026-06-02T13:56:31Z","title":"Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T08:38:44.906160Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.03672"},"observation_digest":"sha256:50ebc4dcf4814047e31c09c6ff857505737c4af43aed3f3d09e7c2a475a3b23d","observation_id":"99a214d0-0985-4774-a150-9dcfd89a5d19","resolution":{"observed_at":"2026-07-02T04:56:39.434750Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:dadc466a94a524ad41246aa0e1ae6018421d96bdab7937a39db32c34fc5fe895","observation_id":"56cca99c-ac62-4935-844d-3307dc3e73b2","resolution":{"observed_at":"2026-06-28T05:21:39.872068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.05889","last_updated":"2026-06-04T08:58:57Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T08:58:57Z","title":"GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T23:53:55.385445Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.05889"},"observation_digest":"sha256:be0fba5f8d41e76d4bb30022c55285e4c8a9450240aec9c1c1a4388a8ba6e269","observation_id":"63bb06b3-a176-42a3-a002-abe3735fdc0a","resolution":{"observed_at":"2026-07-02T15:27:04.883488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.06743","last_updated":"2026-06-04T21:57:18Z","snapshot_observed_at":"2026-08-07T03:21:44.904318Z","submitted_at":"2026-06-04T21:57:18Z","title":"HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T23:27:29.942344Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.06743"},"observation_digest":"sha256:ea02c282e10e92c40c031ec378ee1856832a050012c94149eabc346e7ae7675a","observation_id":"03a510e2-8b82-4fb0-801f-762f3e0dd610","resolution":{"observed_at":"2026-07-02T15:47:06.435229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-07-06T23:46:37.903443Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:1af0075817fb3ab6d0f97d801e8ee9dba6ab414de35b964c3aad3b682e886e33","observation_id":"de8cf5ce-c91f-405e-b045-5ea72d02aea4","resolution":{"observed_at":"2026-07-02T19:47:19.797481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:8b94f22aa4a9dd4e1f5e3eb35cbbef1c36a6484650bdb645b18eaf29f776b6ec","observation_id":"5826c81b-871c-4474-8f24-be0c20aeceb9","resolution":{"observed_at":"2026-07-02T19:57:20.079050Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:5871c86ac3f3e7dcdc5f7911801366318c21267a528825cfd1132cafa867c4c2","observation_id":"6a2f00b2-9121-43f4-a782-855895f90337","resolution":{"observed_at":"2026-07-03T03:07:35.860043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.09050","last_updated":"2026-06-08T05:39:23Z","snapshot_observed_at":"2026-08-01T21:36:59.520330Z","submitted_at":"2026-06-08T05:39:23Z","title":"MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T15:11:53.320505Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.09050"},"observation_digest":"sha256:ebe8603f54f8841edf592339682fe74dc05ed3719d808b44b34b1e52c17f575e","observation_id":"08f970a2-ee8b-4e8f-adbe-114e3cb3ea4e","resolution":{"observed_at":"2026-07-03T03:37:35.401677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-03T07:58:02.783857Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:4dea1d623e962f8785bb43f4f9bba6fcec862a51f82c1fa7d4cbde0f561f8117","observation_id":"5ce2933d-a971-4f6e-84f2-e9b06c8422e7","resolution":{"observed_at":"2026-07-03T03:27:36.133608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.09234","last_updated":"2026-06-08T09:07:23Z","snapshot_observed_at":"2026-08-05T17:27:24.038541Z","submitted_at":"2026-06-08T09:07:23Z","title":"End-to-End Training for Discrete Token LLM based TTS System","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:06.893507Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.09234"},"observation_digest":"sha256:745e9e20e596d60fdc7dd22be7eb68cb40a2a6b78a3dd48b5b0b69681a96f32c","observation_id":"aff23cce-2c94-4fff-a242-33255dcde729","resolution":{"observed_at":"2026-07-03T03:27:34.885277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.12688","last_updated":"2026-06-10T21:22:22Z","snapshot_observed_at":"2026-08-07T01:13:29.099043Z","submitted_at":"2026-06-10T21:22:22Z","title":"M*: A Modular, Extensible, Serving System for Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T10:01:04.153130Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.12688"},"observation_digest":"sha256:7d75ce9645d2f8adfd739459aa8b73b43b5d6350fe2ba4d2dcaed801fdde41b5","observation_id":"71d79e18-eb6a-4310-a9ef-82b96131562b","resolution":{"observed_at":"2026-07-03T10:27:56.693797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.19951","last_updated":"2026-06-18T08:49:24Z","snapshot_observed_at":"2026-08-06T08:37:16.354971Z","submitted_at":"2026-06-18T08:49:24Z","title":"Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T15:57:06.402107Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.19951"},"observation_digest":"sha256:973344a9a1e8fd0713d5755416b596f1329b2d8925085aa472a7708b57a0e07e","observation_id":"d9dd68d5-dbbb-48fa-8d26-52246c014db0","resolution":{"observed_at":"2026-07-04T05:29:35.952858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.20218","last_updated":"2026-06-18T13:32:57Z","snapshot_observed_at":"2026-08-07T14:10:43.984291Z","submitted_at":"2026-06-18T13:32:57Z","title":"Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T15:49:21.097255Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.20218"},"observation_digest":"sha256:18d24f2a587c57a1fc800c7e0bd55d551e93e6c17385b9aa1e9bb53631cdc2c6","observation_id":"9535b3f4-9a54-4aa9-aef8-edd9b2d215f9","resolution":{"observed_at":"2026-07-04T05:39:39.684444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.20266","last_updated":"2026-06-18T14:14:14Z","snapshot_observed_at":"2026-08-07T16:53:00.938422Z","submitted_at":"2026-06-18T14:14:14Z","title":"Transcript-Free Flow-Matching Text-to-Speech via Speech Feature Conditioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T15:38:13.819676Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.20266"},"observation_digest":"sha256:639991093bef50ca60330faa4ca41e26398c9d65fa662112bf978bd65177e5f1","observation_id":"5e24eb89-96f4-4e72-a11c-44b7b17e5bc6","resolution":{"observed_at":"2026-07-04T05:39:40.767341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.21053","last_updated":"2026-06-19T02:36:35Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T02:36:35Z","title":"Imitation Learning for Elder-Facing Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T13:24:48.094668Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.21053"},"observation_digest":"sha256:e8e3cec3346e1f582f910fe647aef980bcecfbe21650410a79048509527f5f66","observation_id":"503ee912-f86a-42e1-811e-e14b1b17ffde","resolution":{"observed_at":"2026-07-04T07:29:39.025813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.21227","last_updated":"2026-06-19T08:47:05Z","snapshot_observed_at":"2026-08-05T17:22:44.002469Z","submitted_at":"2026-06-19T08:47:05Z","title":"Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T13:17:40.718000Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.21227"},"observation_digest":"sha256:c4b044d11427bd0463ea7af79b61fe8e5dd5f868fcae8256cb376cd0415855e8","observation_id":"d3913959-4d88-4849-840a-12893bb77b8e","resolution":{"observed_at":"2026-07-04T07:39:38.482631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.21888","last_updated":"2026-06-20T05:19:07Z","snapshot_observed_at":"2026-08-05T06:35:13.310091Z","submitted_at":"2026-06-20T05:19:07Z","title":"ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T11:49:04.308326Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.21888"},"observation_digest":"sha256:75a21e4c58808c76cc2458b55d32072de96adba0ffc43cf0a5e1a08d86453c4e","observation_id":"4e8f3d24-7753-47da-9c58-309bf989a0a0","resolution":{"observed_at":"2026-07-04T08:19:44.592983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.22811","last_updated":"2026-06-22T03:40:28Z","snapshot_observed_at":"2026-08-02T07:12:51.277365Z","submitted_at":"2026-06-22T03:40:28Z","title":"Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T08:54:18.325054Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.22811"},"observation_digest":"sha256:1eb5f6ddf674015bf86d88fb0f02d40a85ca683faeafab3e7e3d0fc6b07e4e89","observation_id":"c90182f8-5fa8-48f0-9058-3fbfa6ba711d","resolution":{"observed_at":"2026-07-04T10:19:48.001869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:5458f6d5d84ba8d098572e8720f1d0cd74f9b322f7bbf7a5b40a95c59adc0bb9","observation_id":"a6aa5307-c326-4407-96aa-9bb43418adbb","resolution":{"observed_at":"2026-07-04T11:59:50.985665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.02430/citation-record","integrity":"/paper/2406.02430/integrity","json":"/paper/2406.02430/citation-record.json","paper":"/paper/2406.02430"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming voice conversion via intermediate bottleneck features and non-streaming teacher guidance","venue":null,"work_id":"083f5388-e34c-4a4d-b4e1-7770c7aade6c","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:7bcccaeda9fd4e0d7d689f20ebd4a216c3bb1c7a9feffbee68b0075dcfc72c61","observation_id":"4756c9b5-0052-4463-b6c7-7f5322bf9b4c","resolution":{"observed_at":"2026-05-15T12:26:37.509092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11053","last_updated":"2024-07-19T02:22:44Z","snapshot_observed_at":"2026-07-06T17:18:07.753001Z","submitted_at":"2024-01-19T23:05:05Z","title":"StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion","version":5},"cited_work":{"arxiv_id":"2401.11053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.11053","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"StreamV oice: Streamable context-aware language modeling for real-time zero-shot voice conversion","venue":null,"work_id":"9bb06a48-785f-4d9f-b05c-8f8580345daf","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2401.11053","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:2087a47f4d49e052a3f5bf3c3930ec85a833b6448a1427ecaa5e30fa894737ec","observation_id":"7a3c3035-377d-4058-b211-d959de06cbb1","resolution":{"observed_at":"2026-05-15T12:26:37.331901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:e8b965a333db46655c8a11f68d4032a2578d3220d743296884f8c919e52159cc","observation_id":"e2f60dc4-b155-4d77-ad62-d3f221336643","resolution":{"observed_at":"2026-05-15T12:26:37.337799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":"2306.03509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-07-04T08:19:44.612291Z","title":"Mega-tts: Zero-shot text-to-speech at scale with intrinsic inductive bias","venue":null,"work_id":"304a4ad2-1fb2-4a0d-a21a-8947af9e12c7","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:9f9a8e535fb67032f9e2020f5c2daecd2ed4886e0bbf10677df865ec568aabbe","observation_id":"53c5908d-2c1c-4b39-8fe2-588f9940ae35","resolution":{"observed_at":"2026-05-15T12:26:37.342857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07274","last_updated":"2018-11-26T04:56:31Z","snapshot_observed_at":"2026-07-06T05:27:30.168672Z","submitted_at":"2017-01-25T11:52:11Z","title":"Deep Reinforcement Learning: An Overview","version":6},"cited_work":{"arxiv_id":"1701.07274","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.07274","snapshot_observed_at":"2026-07-04T19:00:06.264165Z","title":"Deep Reinforcement Learning: An Overview","venue":"cs.LG","work_id":"68a5d043-bfc1-49c5-9396-40bb3d602cee","year":2017},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/1701.07274","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:382ab5903ac49c9e36d5217859a8ef1143264c0acb9de604c396cdb8f136e504","observation_id":"006c7288-10a0-4add-ba1c-330ff6c2651a","resolution":{"observed_at":"2026-05-15T12:26:37.347675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":"2303.03926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-07-08T00:04:22.393626Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":"cs.CL","work_id":"0825378e-00d8-4678-bea7-360d1adc8eef","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:5981ee1c06a07425df44c3ca621679b46bd33952162cb93b6f0ea408c1fb033b","observation_id":"979bebc8-0d3e-45fd-8ca7-22bb17eac15d","resolution":{"observed_at":"2026-05-15T12:26:37.352136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14518","last_updated":"2022-12-30T02:31:35Z","snapshot_observed_at":"2026-07-06T14:36:01.830787Z","submitted_at":"2022-12-30T02:31:35Z","title":"ResGrad: Residual Denoising Diffusion Probabilistic Models for Text to Speech","version":1},"cited_work":{"arxiv_id":"2212.14518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.14518","snapshot_observed_at":"2026-07-02T02:36:27.517412Z","title":"ResGrad: Residual denoising diffusion probabilistic models for text to speech","venue":null,"work_id":"8b5c44d1-fd56-46a9-9f24-1a9dff097318","year":2022},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2212.14518","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:0ee8a64cbb4850eca3624366720bb129e756fe51a54e14df326e5aa6695cb4d2","observation_id":"644271db-4c5d-4826-9649-6a0f66576348","resolution":{"observed_at":"2026-05-15T12:26:37.358488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:01b4ab37fd9d50337e2bd646170bca42f40a2f6d8ee6589e07557fcdbeb6cd91","observation_id":"1d4b87f3-9a05-4801-bdb4-14a32e18b6dc","resolution":{"observed_at":"2026-05-15T12:26:37.364028Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:9605f42bd905d9f2371189b643e52a4354e91e9e194eb88fe65f613051ef019b","observation_id":"36c79e26-f01d-4b1e-954a-a6c8070fc732","resolution":{"observed_at":"2026-05-15T12:26:37.369560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:3763796ba4e5a5b8ab349eb03042be63a0fb4df2fb026e2f009ad4a086825df2","observation_id":"d23726c2-113b-44f4-aa51-28e4166d5cf8","resolution":{"observed_at":"2026-05-15T12:26:37.374042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10831","last_updated":"2021-06-22T01:48:17Z","snapshot_observed_at":"2026-08-04T10:54:31.614032Z","submitted_at":"2021-06-21T03:44:51Z","title":"Glow-WaveGAN: Learning Speech Representations from GAN-based Variational Auto-Encoder For High Fidelity Flow-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2106.10831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.10831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glow-WaveGAN: Learning speech representations from gan-based variational auto-encoder for high fidelity flow-based speech synthesis","venue":null,"work_id":"fe9768a6-2f3c-4009-a7a8-db1d5d51ab84","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2106.10831","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:866ffb8b7d37aaba258591a3b811b910ade2ae855f7f64cf093d57f4320228e1","observation_id":"0441f097-3029-4902-b262-3fe63dad3c05","resolution":{"observed_at":"2026-05-15T12:26:37.325985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13419","last_updated":"2021-06-25T04:18:33Z","snapshot_observed_at":"2026-08-01T00:00:52.823725Z","submitted_at":"2021-06-25T04:18:33Z","title":"Basis-MelGAN: Efficient Neural Vocoder Based on Audio Decomposition","version":1},"cited_work":{"arxiv_id":"2106.13419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13419","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Basis-MelGAN: Efficient neural vocoder based on audio decomposi- tion","venue":null,"work_id":"c2fc3269-1d99-4596-ad8e-9615c7bc2449","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2106.13419","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:1d6a87aa6e4182d2e4fceb3d0a22bd83fee07bd967d0ef3afb790935291c2f49","observation_id":"dd3e66ab-0ea7-41fc-af35-223fa74ac991","resolution":{"observed_at":"2026-05-15T12:26:37.417345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:3e81daf1ce5401a0b15df4813e28703972b4cd3f7eace1134f8cc13ab9266f69","observation_id":"d7ebdee7-0e41-4c7c-89d6-d2cb89f158a1","resolution":{"observed_at":"2026-05-15T12:26:37.422301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DiDiSpeech: A large scale mandarin speech corpus","venue":null,"work_id":"b5c45e25-e05d-46ba-89ae-558894c44cf9","year":2021},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:2af0a0e80c19eb32516399b4633c68130e6933e456ca58b483b9a50af4f3a9c4","observation_id":"8e025bd0-40a1-40b1-89aa-44c5492b1da1","resolution":{"observed_at":"2026-05-15T12:26:37.518068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-06T08:18:02.266041Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:b2fb8f6800ce973f5128ace1459c14fafa89c89250f7e313657b2677b7cc009a","observation_id":"029a82d4-079b-478f-abb3-40d13ae9a8f8","resolution":{"observed_at":"2026-05-15T12:26:37.427555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":"2006.04558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-07-08T18:15:21.399873Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","venue":"eess.AS","work_id":"415023d2-900f-4bda-a774-38e2d95b7a8f","year":2020},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:27f414abea1d826e14ed1f18147957550785b847c994d1bb6904505b6be62dc3","observation_id":"e3ced301-f751-4fa9-a4b5-f08d66b409ff","resolution":{"observed_at":"2026-05-15T12:26:37.432620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06088","last_updated":"2022-07-13T09:57:06Z","snapshot_observed_at":"2026-08-04T04:35:27.210075Z","submitted_at":"2022-07-13T09:57:06Z","title":"Controllable and Lossless Non-Autoregressive End-to-End Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2207.06088","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.06088","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Controllable and lossless non-autoregressive end-to-end text-to-speech","venue":null,"work_id":"b35a5152-95dd-4f98-b957-7bbd6cb47917","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2207.06088","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:3e17f4e952204f9f9149127b00cdf2ab03a0ddd1e5e1be0e264eeafde43af093","observation_id":"f7720dba-20cb-429d-9c36-7acfce416ee8","resolution":{"observed_at":"2026-05-15T12:26:37.437031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LibriSpeech: an ASR corpus based on public domain audio books","venue":null,"work_id":"a1ff6368-1d79-47b2-b6c2-8f42aab01198","year":2015},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:6177ddc30d18ac8516a310b69f129da16e079f7b40418fb6c8a090c1f10b7388","observation_id":"4888ea06-1982-4030-9480-89c7d4842d21","resolution":{"observed_at":"2026-05-15T12:26:37.512281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15455","last_updated":"2022-07-05T07:47:22Z","snapshot_observed_at":"2026-08-04T17:29:16.369037Z","submitted_at":"2022-03-29T11:54:34Z","title":"WeNet 2.0: More Productive End-to-End Speech Recognition Toolkit","version":2},"cited_work":{"arxiv_id":"2203.15455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.15455","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WeNet 2.0: More productive end-to-end speech recognition toolkit","venue":null,"work_id":"164b8027-d4eb-4bf1-a25a-5ce28609ad1f","year":2022},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2203.15455","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:3489e402fc59b4a15fdcbd8ab9f527e92c12f38b0ec6cb736285822594e959a1","observation_id":"3bf8aecc-c6a2-43e1-bde2-2c0212de1e5e","resolution":{"observed_at":"2026-05-15T12:26:37.442050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Developing far-field speaker system via teacher-student learning","venue":null,"work_id":"9d7d81d6-a335-459d-8b5e-8c9f1813b240","year":2018},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:d834f865c48b8d421df268d0a84a7dde6e5a3c2a2cb6ba1a2c3acba161b8457b","observation_id":"244c1ec1-8efe-40cb-824b-9ec48aa3bb21","resolution":{"observed_at":"2026-05-15T12:26:37.520505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-02T05:48:34.226234Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":"1706.08612","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-07-10T15:47:23.359432Z","title":"V oxceleb: a large-scale speaker identiﬁcation dataset","venue":"cs.SD","work_id":"24233098-118b-4164-aa92-a86ff8eaf0f9","year":2017},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:97e244a6c59929d1df2fe11cf9b01f3e8c44eea56387e651826f836ee080ce8e","observation_id":"be268926-e6b8-4033-9530-b496693524b1","resolution":{"observed_at":"2026-05-15T12:26:37.447207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08977","last_updated":"2019-06-21T06:40:06Z","snapshot_observed_at":"2026-07-06T08:01:53.211305Z","submitted_at":"2019-06-21T06:40:06Z","title":"Singing Voice Synthesis Using Deep Autoregressive Neural Networks for Acoustic Modeling","version":1},"cited_work":{"arxiv_id":"1906.08977","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.08977","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singing Voice Synthesis Using Deep Autoregressive Neural Networks for Acoustic Modeling","venue":"cs.SD","work_id":"e2bd2ba7-b448-4ab9-9607-1c94ff572048","year":2019},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/1906.08977","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:ad70ac4d8e34987b9728940e01c81b9cea97ea83fdf99f1fc262a65f3242ef56","observation_id":"feb995b5-9758-4d62-b15d-8bf198e9a477","resolution":{"observed_at":"2026-05-15T12:26:37.451102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LiteSing: Towards fast, lightweight and expressive singing voice synthesis","venue":null,"work_id":"ae5b7deb-005f-4fd4-96ab-7cc6a4743502","year":2021},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:477e727541957f90a04776cfa47cd4544585d3fca353a8fa61aaef284d621188","observation_id":"1a553839-b497-4fc3-8507-673b51d844c1","resolution":{"observed_at":"2026-05-15T12:26:37.515667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prosody-aware SpeechT5 for expressive neural TTS","venue":null,"work_id":"8814eda1-a994-4920-b8ef-b2a9ce57c954","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:a6a33bca6a2fefb07b4a71fb97c5aa1ed888bf4bdd5a440c0e6c4c9ec5205c0e","observation_id":"eaab47d9-a256-4d2c-bb7c-82f7902d3886","resolution":{"observed_at":"2026-05-15T12:26:37.522911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:b410b2dee0393e128432ebbf960bc11b651abf71981420d1a11578cc263fdcca","observation_id":"8d25e85c-fb2c-4627-a062-0503dff6d454","resolution":{"observed_at":"2026-05-15T12:26:37.455658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":"2310.04378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-07-08T10:54:49.201621Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","venue":"cs.CV","work_id":"53b1d836-7feb-402c-97c7-87b9bc51196f","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:9bb5ed3f391c2168682ebd78ce009170c8b9dc3e74ccf8d31eb861cdfe841c78","observation_id":"75228981-875d-439e-84e7-34cba46e75a8","resolution":{"observed_at":"2026-05-15T12:26:37.460225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":"2306.00978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-07-10T11:17:03.640788Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","venue":"cs.CL","work_id":"ea9d1d72-db24-4cae-8c89-4ecd83dd87c1","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:b8ec5ec41453fb00ba2678ea2784a3beee198e95d455748e9766ac7b0b212341","observation_id":"5126f41a-d88e-41e7-b8cc-29a36906a6a9","resolution":{"observed_at":"2026-05-15T12:26:37.464522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":"2303.01469","doi":"10.48550/arxiv.2303.01469","metadata_source":"pith","pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Consistency Models","venue":"cs.LG","work_id":"502bf494-8fcd-434f-828f-0566ab606719","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:be41d115cc86cb27007885ec27501c7010adec6903b7129c4895edab37d8d781","observation_id":"2416902b-a921-482c-bde9-5c4c5826eb96","resolution":{"observed_at":"2026-05-15T12:26:37.468540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:56.48998+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:56.48998+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2403.03206","doi":"10.48550/arxiv.2403.03206","metadata_source":"pith","pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"4dc55d76-271e-42dd-878f-c20546599c69","year":2024},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:7225fdde47dde16fd7e0f909a0b010a63f502fa20e29c4ab660edd45f0ad1806","observation_id":"f8a34ae0-e1a1-436d-acc6-d9a3c263153c","resolution":{"observed_at":"2026-05-15T12:26:37.472833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:b1d5d7fc5597a5cd1f97e25c30268f18025697bb92c08f4f5b2eb6ffc58c9776","observation_id":"8fa63e6b-41c5-4885-a1e7-7d0509da4b5a","resolution":{"observed_at":"2026-05-15T12:26:37.476810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08295","last_updated":"2021-06-15T17:12:42Z","snapshot_observed_at":"2026-08-02T11:19:40.664702Z","submitted_at":"2021-06-15T17:12:42Z","title":"A White Paper on Neural Network Quantization","version":1},"cited_work":{"arxiv_id":"2106.08295","doi":"10.48550/arxiv.2106.08295","metadata_source":"pith","pith_arxiv_id":"2106.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A White Paper on Neural Network Quantization","venue":"cs.LG","work_id":"7560ab05-45c2-4a5f-8b54-693bdf37c816","year":2021},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2106.08295","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:f75844281fea22417c8e2ba667ed326d406029946a761ca68a44ac4187f5e3f9","observation_id":"8e4d6af0-fd01-47db-b303-3273d6c9719c","resolution":{"observed_at":"2026-05-17T04:10:55.058388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12759","last_updated":"2024-04-19T10:02:53Z","snapshot_observed_at":"2026-07-06T18:02:36.759308Z","submitted_at":"2024-04-19T10:02:53Z","title":"decoupleQ: Towards 2-bit Post-Training Uniform Quantization via decoupling Parameters into Integer and Floating Points","version":1},"cited_work":{"arxiv_id":"2404.12759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.12759","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"decoupleq: Towards 2-bit post-training uniform quantization via decoupling parameters into integer and floating points","venue":null,"work_id":"530cc959-a895-4fda-b53c-8d0141c6bedd","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2404.12759","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:f92cf5dbe346a5c10f04f7ec817193e840aa1f093846b76e76b178a7efb3685a","observation_id":"2435136e-38f8-4e99-84cf-e3400f2314c3","resolution":{"observed_at":"2026-05-15T12:26:37.485178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06674","last_updated":"2024-04-11T17:52:15Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-10T01:33:08Z","title":"VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing","version":2},"cited_work":{"arxiv_id":"2404.06674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.06674","snapshot_observed_at":"2026-07-04T08:39:41.912271Z","title":"V oiceShop: A unified speech-to-speech framework for identity- preserving zero-shot voice editing","venue":null,"work_id":"bf38949a-96c9-4dfa-80de-447bbef13b20","year":2024},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2404.06674","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:63f25e18b2a15df6220ea43d6ca4300b219bacf80ad8e71840b672ebbe7bd851","observation_id":"6092f1ee-f92a-4a94-96ec-7c9a045bf1c2","resolution":{"observed_at":"2026-05-15T12:26:37.489334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2311.12454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HierSpeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis","venue":null,"work_id":"c59facf9-9954-41f2-9815-2d2208f22d1b","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:303752f7b969289eaa3035817d1bb20f40314be05e8c108b3596227d53d4dce3","observation_id":"1b46cae5-38b9-4e85-b7a8-66bdc50c31c2","resolution":{"observed_at":"2026-05-15T12:26:37.493296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05751","last_updated":"2023-08-10T11:49:17Z","snapshot_observed_at":"2026-07-06T14:29:20.607029Z","submitted_at":"2022-12-12T08:02:02Z","title":"Zero-Shot Accent Conversion using Pseudo Siamese Disentanglement Network","version":2},"cited_work":{"arxiv_id":"2212.05751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05751","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot accent conversion using pseudo siamese disentanglement network","venue":null,"work_id":"bf676f40-c743-4ce7-8767-e18dda1974c4","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2212.05751","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:9dce6da6ba4e40dc42140c17525e39afc685e1f59f11ea4031e90594c471e669","observation_id":"09a8622b-3123-44d5-bc89-b24fd7ab793b","resolution":{"observed_at":"2026-05-15T12:26:37.497056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-07T17:24:03.888611Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":"2109.13821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-based voice conversion with fast maximum likelihood sampling scheme","venue":null,"work_id":"b98a9957-671e-40c3-b314-a143f34ed660","year":2021},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:fc6f05594e7c4d36f0a99623d3d0b05badc71ea1d842531417983674796d0243","observation_id":"c7ee5465-f4e3-43ff-a7f0-10f80a53ac2a","resolution":{"observed_at":"2026-05-15T12:26:37.501347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:fd70d482aee268a4286e4d75be4c416409fbfb655ec81d2fe7cdf86326a0b76f","observation_id":"5e45a6f5-b77a-4f83-867a-09990480a4b3","resolution":{"observed_at":"2026-05-15T12:26:37.505827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12908","last_updated":"2023-11-21T15:24:05Z","snapshot_observed_at":"2026-07-06T16:50:46.608196Z","submitted_at":"2023-11-21T15:24:05Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2311.12908","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12908","snapshot_observed_at":"2026-07-09T02:25:55.896149Z","title":"Diffusion model alignment using direct preference optimization.arXiv preprint arXiv:2311.12908","venue":"cs.CV","work_id":"1941def8-837f-49f0-b80c-bb513ed3eeeb","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2311.12908","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:09a1e826609a8854c8fe63da985d4ef6e0e89c4ea3136c9922fa26746ba2fb37","observation_id":"985d286e-bda1-4c57-81d3-b0dcdb611313","resolution":{"observed_at":"2026-05-15T12:26:37.380158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04229","last_updated":"2024-02-06T18:36:52Z","snapshot_observed_at":"2026-08-07T03:55:52.770411Z","submitted_at":"2024-02-06T18:36:52Z","title":"MusicRL: Aligning Music Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":"2402.04229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04229","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MusicRL: Aligning music generation to human preferences","venue":null,"work_id":"cbad263c-69c8-45c5-b38e-78ab46149045","year":null},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2402.04229","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:dead189f59eb40cb889ac7c9cfd74394499ebdc8ca473b42e2f5cdf46539e175","observation_id":"2cae3087-dbe4-41ee-a48a-66159963c655","resolution":{"observed_at":"2026-05-15T12:26:37.384884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05600","last_updated":"2024-04-08T15:21:17Z","snapshot_observed_at":"2026-08-05T11:57:00.393189Z","submitted_at":"2024-04-08T15:21:17Z","title":"SpeechAlign: Aligning Speech Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":"2404.05600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05600","snapshot_observed_at":"2026-07-10T10:37:01.579016Z","title":"SpeechAlign: Aligning speech generation to human preferences","venue":"cs.CL","work_id":"374bf864-7e85-42ed-acac-9de2a595aba1","year":2024},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2404.05600","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:b5e1577d75de5c8451faca94fbe552abde64e0d270e19c5fdd0848b06c79bb83","observation_id":"2b1927a3-db00-49e5-9f38-c32ea6a04dea","resolution":{"observed_at":"2026-05-15T12:26:37.389182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:a98dc7899ed77c7755cdb5a8fbd27a38c813684500a9500b90eefc0fbbdfda7a","observation_id":"aa06ca70-0c3d-4002-80f4-1a3e4a9dc51a","resolution":{"observed_at":"2026-05-15T12:26:37.394037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimum word error rate training for attention-based sequence-to-sequence models","venue":null,"work_id":"a8ce2ebc-b0a9-4e46-8a37-1daedf56109c","year":2018},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:6257798a0275295b7ccaf813a694c86bbd24ce5db3946ccd7bcacaa262950a8f","observation_id":"b1a582d4-f2e3-43b8-a5b4-83a6915af56d","resolution":{"observed_at":"2026-05-15T12:26:37.525092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00742","last_updated":"2024-07-19T05:12:15Z","snapshot_observed_at":"2026-07-06T17:23:47.717199Z","submitted_at":"2024-02-01T16:39:28Z","title":"Transforming and Combining Rewards for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.00742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00742","snapshot_observed_at":"2026-07-03T09:07:47.876920Z","title":"Transforming and combining rewards for aligning large language models","venue":null,"work_id":"ff56065b-a9ee-49e8-adb5-406a63150334","year":2024},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2402.00742","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:e039d38fcfdb3496d61b9f1d6f99c2681c50f11221d957bc00e37171b61d2f1f","observation_id":"3fffca85-55af-4cda-a00a-bed68e84db18","resolution":{"observed_at":"2026-05-15T12:26:37.399932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:50038c3a04de9b7ea1ce77a4671b438a209ce7dc147ebe6b3a600443d19aa6d4","observation_id":"8269caef-9368-47f3-809b-a6a66bde15fd","resolution":{"observed_at":"2026-05-15T12:26:37.406253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06873","last_updated":"2024-06-25T18:38:28Z","snapshot_observed_at":"2026-07-06T16:05:47.011408Z","submitted_at":"2023-08-14T01:01:19Z","title":"SpeechX: Neural Codec Language Model as a Versatile Speech Transformer","version":2},"cited_work":{"arxiv_id":"2308.06873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.06873","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpeechX: Neural codec language model as a versatile speech transformer","venue":null,"work_id":"5077483b-4a04-4dae-8329-c776a4cca40e","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2308.06873","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:25f1e6a164724111e05942f423816e11c4d39c497167b8b6ed7d00d788523efb","observation_id":"cb7da3c8-9b5c-419a-aa7b-70d4dd5b084d","resolution":{"observed_at":"2026-05-15T12:26:37.412512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":7},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 100 inbound Pith citation observations for arXiv:2406.02430."}