{"as_of":"2026-08-23T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f70edcb6a15744f9ce98a738b329747862bc5c25e78034b2106225c2153f84c","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:49.220696Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02023/citation-record","integrity":"/paper/2608.02023/integrity","json":"/paper/2608.02023/citation-record.json","paper":"/paper/2608.02023"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-16T13:36:59.551255Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-07T00:14:41.102675Z","title":"Funaudiollm: Voice understanding and generation foundation models for natural interaction between humans and llms.arXiv preprint arXiv:2407.04051, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.102675Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:dd059ed588542c53c592ba133f49ae2e0912fa74ef2f8fe6569d0d687a3b1e45","observation_id":"e5b0fa62-cc15-4b0d-8bdb-819fafbdea60","resolution":{"observed_at":"2026-08-07T00:14:41.102675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:41.196456Z","title":"Ultimate vocal remover.GitHub repository, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.196456Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:8209cd54b4555357f4b067a031534339c293411117b1c0be972d7b88f1ed57ee","observation_id":"3e07fb11-6f18-4911-a4a6-c6b6b5f1b191","resolution":{"observed_at":"2026-08-07T00:14:41.196456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T00:14:41.280587Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.280587Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:47c86cc9b6c875904a54cc0ced43444b6c6c7f263fdc360430a58fc2ae180675","observation_id":"e059a6e2-3ede-44b1-84b5-45540c4c9427","resolution":{"observed_at":"2026-08-07T00:14:41.280587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-20T02:06:16.288063Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-07T00:14:41.363603Z","title":"Whisperx: Time-accurate speech transcription of long-form audio","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.363603Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:deded2aa8e572caa1168d90c940f39cc462451d9e1f68df8eb484028b127b202","observation_id":"50f70143-b4a3-409d-83a3-d9f70d7afe28","resolution":{"observed_at":"2026-08-07T00:14:41.363603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:41.453324Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.453324Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:cdcf02f7e73d060b1b617f011a42af27559153cea5a847c7b87cf9ca805a0666","observation_id":"98db6794-4613-41d4-b1f3-a4e8e93a67df","resolution":{"observed_at":"2026-08-07T00:14:41.453324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:41.534869Z","title":"Seed2.0, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.534869Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:524edf90e5e160b996b8709b89b41044231321c2e713c18a19f0ca040e34f7dd","observation_id":"b0b577c6-f76c-49ab-8ec8-705439e43e4b","resolution":{"observed_at":"2026-08-07T00:14:41.534869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:41.593752Z","title":"Seed Speech ASR 2.0 Documentation.BytePlus documentation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.593752Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:cc7f4f422dc5b70823fb9562bcb6073fddd4b457baef9eb82301f18720ef6634","observation_id":"825e6a81-4696-4ec4-9c5d-072f943e5227","resolution":{"observed_at":"2026-08-07T00:14:41.593752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:41.675718Z","title":"FlexiVoice: Enabling flexible style control in zero-shot TTS with natural language instructions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.675718Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:e577df24925d2422df2d4a94d9fdd697eb50828c039366cb87df84ce080bfe68","observation_id":"7bc06fd7-2e8a-4e25-90cd-136a05fd081e","resolution":{"observed_at":"2026-08-07T00:14:41.675718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T00:14:41.762978Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.762978Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:2723e0756e090569268d9562a4bd882b7ea0589d9e111d638bfbe6ec05c53a5c","observation_id":"b8863186-fa0b-4565-b00b-518392991fb4","resolution":{"observed_at":"2026-08-07T00:14:41.762978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:41.850191Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.850191Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:7d81d84e7d04d5c95c89aba6c49df92e7d95300a90aae52474632902d7d0d6d9","observation_id":"ebceb8d1-6133-48d2-9af2-c7551f683a26","resolution":{"observed_at":"2026-08-07T00:14:41.850191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:41.931436Z","title":"3d-speaker-toolkit: An open-source toolkit for multimodal speaker verifi- cation and diarization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.931436Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:30bce2eb56fb7d8720dd7014870f7b21e51f133e7def2d940ae311da63d29f9c","observation_id":"80a543f5-a0a0-44b8-b3fb-d3e4ff8eec92","resolution":{"observed_at":"2026-08-07T00:14:41.931436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.16578","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:53.766767Z","title":"SeniorTalk: A chinese conversation dataset with rich annotations for super-aged seniors","venue":null,"work_id":"4e234d99-a795-4094-8005-08350ee46850","year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.989969Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:645c49cf81542bbe7eda7cadc47ada039cbe1f4737879b16abf3aae5d52c2378","observation_id":"2115d0ec-3fc9-4b3c-9ab8-63d41e39a447","resolution":{"observed_at":"2026-08-07T00:14:53.843147Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T00:14:42.071504Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching.arXiv preprint arXiv:2410.06885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.071504Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:91f4fd862d4226f9cdd8a048145948348547dd7b420250bbec5905bf3a9fe31a","observation_id":"26617ea3-3047-4c0c-89fa-e2d4ecbb251a","resolution":{"observed_at":"2026-08-07T00:14:42.071504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07372","last_updated":"2026-07-12T07:41:31Z","snapshot_observed_at":"2026-08-15T16:31:19.460938Z","submitted_at":"2026-01-12T09:54:49Z","title":"Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07372","snapshot_observed_at":"2026-08-07T00:14:42.146192Z","title":"Conditional memory via scalable lookup: A new axis of sparsity for large language models.arXiv preprint arXiv:2601.07372, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.146192Z"},"links":{"cited_paper":"/paper/2601.07372","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:a6b30b87819a24b3b64d44be2c3c40af3c8ae5a4b7ed7b192332cc985f298535","observation_id":"bab600fc-9fff-4482-87cb-ad71cb6b8404","resolution":{"observed_at":"2026-08-07T00:14:42.146192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:42.210992Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.210992Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:49ffb3c953813a13bba5c8fa162f5e295509c733f6f8038d2c5136b99dedf44a","observation_id":"56a395f1-300c-42b5-9e9a-970f52391e57","resolution":{"observed_at":"2026-08-07T00:14:42.210992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03240","last_updated":"2019-06-19T03:27:39Z","snapshot_observed_at":"2026-08-14T16:50:58.198217Z","submitted_at":"2019-04-05T19:04:19Z","title":"An Unsupervised Autoregressive Model for Speech Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03240","snapshot_observed_at":"2026-08-07T00:14:42.280938Z","title":"An unsupervised autoregressive model for speech representation learning","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.280938Z"},"links":{"cited_paper":"/paper/1904.03240","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:35d60516d206b4ece910ba377e6004c417cd9f85d780c5ba38ab15f1459cfa79","observation_id":"8a894298-99d8-4ad0-9db8-60155983ecf2","resolution":{"observed_at":"2026-08-07T00:14:42.280938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-07T00:14:42.345506Z","title":"GLM-4-Voice: Towards intelligent and human-like end-to-end spoken chatbot.arXiv preprint arXiv:2507.01006, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.345506Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:bcf59b974f3b068d70ee9e8b221ca8ac36ad7eeb2db3e5b37de81c6809599fd7","observation_id":"5538af60-d184-442e-9b29-e5546f3af888","resolution":{"observed_at":"2026-08-07T00:14:42.345506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-18T13:55:31.813413Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T00:14:42.422224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.422224Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:8ad4268675973ec72e6122b27bbfc84167c5d20487af942996a00103252cdd3c","observation_id":"fa4d01e6-0e87-4803-bcab-35f737f7ba19","resolution":{"observed_at":"2026-08-07T00:14:42.422224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T00:14:42.483675Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.483675Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:88ae23197958eab07045e2b704b55929a3225a4eb1ed302e82dae3e11af45918","observation_id":"406b16fb-4c00-4ca5-b61a-2ad9403cd726","resolution":{"observed_at":"2026-08-07T00:14:42.483675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:42.547078Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.547078Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:ca1763449c2b00bd3ffd878c5e33f98437620f099da7036bccc104959584f0fc","observation_id":"629d49a3-6ef6-4718-bcc5-644e9df7c498","resolution":{"observed_at":"2026-08-07T00:14:42.547078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T00:14:42.592339Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.592339Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:ba4c1bab92e1187f292cdcf3f5aaabf3a5f2cc29517e9faa3ca8ab4c1cf83b2c","observation_id":"5e7f5f51-4028-4126-bf09-e77a18dda934","resolution":{"observed_at":"2026-08-07T00:14:42.592339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-07T00:14:42.646582Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training.arXiv preprint arXiv:2505.17589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.646582Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:d19b3574813e7c4876aa71f818e4a4476141632cce881623f02ec1a6bb5b4d63","observation_id":"9a2c3f76-4745-4fa3-b25e-6a030932b29c","resolution":{"observed_at":"2026-08-07T00:14:42.646582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:42.701090Z","title":"Stable audio open","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.701090Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:54f8e002a65435a783ffe0fa5ff95b524ef4b364e4eae73f7e5e8b351214b81a","observation_id":"275a5ee0-2cdb-44f1-beeb-8887c4937a8c","resolution":{"observed_at":"2026-08-07T00:14:42.701090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17991","last_updated":"2026-05-18T07:47:03Z","snapshot_observed_at":"2026-08-16T06:50:56.794163Z","submitted_at":"2026-05-18T07:47:03Z","title":"Stable Audio 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17991","snapshot_observed_at":"2026-08-07T00:14:42.763577Z","title":"Stable audio 3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.763577Z"},"links":{"cited_paper":"/paper/2605.17991","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:8784bc7f6056e74d637b761cd554996b107254332373dbe2418a90a7378089c3","observation_id":"1ea08738-fe24-4a9c-b9d0-96302d56204a","resolution":{"observed_at":"2026-08-07T00:14:42.763577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:42.814904Z","title":"Falk, Chenxi Zheng, and Wai-Yip Chan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.814904Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:6bf875059e93d5e19dde56fff6b08f7f76a7ca92b9058bcbc8a3b375ab6b7c27","observation_id":"e8ce8da0-1d8f-4a2a-8137-1dab0c692588","resolution":{"observed_at":"2026-08-07T00:14:42.814904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:42.943789Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:42.943789Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:abb5d17e6b7f8d3dbd7fdbab6166e016f0e9ac188045438bcd0ac23bd17a1ca8","observation_id":"468a3151-13de-494f-bb8d-c1a995014d54","resolution":{"observed_at":"2026-08-07T00:14:42.943789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T00:14:43.018619Z","title":"Fish-Speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.018619Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:2c0f50d2480c07a3ea986c561369aadfc724029fbbbc4c064cfd75d8828ff2e9","observation_id":"ee3559cc-902c-4a5e-8aa7-a43b9f23cc53","resolution":{"observed_at":"2026-08-07T00:14:43.018619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.073690Z","title":"Fsd50k: an open dataset of human-labeled sound events.IEEE/ACM Transactionson Audio, Speech, and Language Processing, 30:829–852, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.073690Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:9514d0a45c9cac344df1dd07d7a52175c04528258e905fd613f7454249c44fd8","observation_id":"9fc33832-c003-4685-a1b1-7ee3ac42e8c2","resolution":{"observed_at":"2026-08-07T00:14:43.073690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-07T00:14:43.128810Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.128810Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:3421137ceb4a14460072c657f8d85b6b49b90ba54d56cba22c7501c3b828e5e7","observation_id":"0518d6f5-8d75-48c3-b78a-d633529e7370","resolution":{"observed_at":"2026-08-07T00:14:43.128810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.186318Z","title":"Gemini 2.5 Pro model card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.186318Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:ad1daddda8ac88b770a74b35a1e39d031b458c402f2075dd3ebc7c3f19b71357","observation_id":"4c21aa88-2213-4606-98eb-e49dc3c1c900","resolution":{"observed_at":"2026-08-07T00:14:43.186318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.234916Z","title":"Gemini 3 Pro model card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.234916Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:2d5783f0d1bb0d6900fabb38cf253e71f7d8d4173efebf3cdc10661cd5ca4029","observation_id":"a1ba9792-4aab-40b9-9f65-7f4614df886a","resolution":{"observed_at":"2026-08-07T00:14:43.234916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.287513Z","title":"Gemini 3.5 Flash model card, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.287513Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:f67e2603f4881d8acd1591ddadc93b89e16286f17dc913c21476c05fc7c17874","observation_id":"8f428483-1094-474a-94e4-b9c1f8069bcc","resolution":{"observed_at":"2026-08-07T00:14:43.287513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1976.11628","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:53.033997Z","title":"Gray and John D","venue":null,"work_id":"f297d115-e61a-4417-8fe9-bec0331143b7","year":1976},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.350871Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:de1f44400017528443095b8eca40c50fb2160b32a7b20435ad687379f294cdd4","observation_id":"398c03d8-690b-4022-b369-76dbf280892e","resolution":{"observed_at":"2026-08-07T00:14:53.099472Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.425923Z","title":"MRSAudio: A large-scale multimodal recorded spatial audio dataset with refined annotations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.425923Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:72e1de5af6b228a2ec9252bbf9c32b44f639dcd217529d297a209fe7026f6e7f","observation_id":"13cb153f-3be4-453e-b761-803c1b53ce09","resolution":{"observed_at":"2026-08-07T00:14:43.425923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12572","last_updated":"2025-04-21T14:43:30Z","snapshot_observed_at":"2026-08-16T12:57:27.209603Z","submitted_at":"2025-02-18T06:25:07Z","title":"TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12572","snapshot_observed_at":"2026-08-07T00:14:43.486294Z","title":"Techsinger: Technique controllable multilingual singing voice synthesis via flow matching.arXiv preprint arXiv:2502.12572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.486294Z"},"links":{"cited_paper":"/paper/2502.12572","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:24a6cc88290bf975f597dbae9002364fb916f49f86b8d14a9eb12e595b865a1d","observation_id":"3aaee3ad-b073-4f0a-8d1b-5cdf76fa6c1b","resolution":{"observed_at":"2026-08-07T00:14:43.486294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.568806Z","title":"STARS: A unified framework for singing transcription, alignment, and refined style annotation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.568806Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:32bd0d76e76ceddcb523ec1b593f027872670b8a9ec0bc0f3be63a5f37405a33","observation_id":"0675b870-9e75-46ce-a1c9-36c8511e58e6","resolution":{"observed_at":"2026-08-07T00:14:43.568806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T00:14:43.690618Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.690618Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:d989a9ce4e5c89aa0c597779da3c2f53c8039d08edff4d0d70d27beadccf667f","observation_id":"5b288ef5-2c01-4a1f-824a-60db308d8ab5","resolution":{"observed_at":"2026-08-07T00:14:43.690618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.751576Z","title":"VoiceSculptor: Your voice, designed by you.arXiv preprint arXiv:2601.10629, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.751576Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:bb60622ec9bcbc0462c6029219abe26a0f130d844a464202a905613e63121d36","observation_id":"e949b5c7-b8f6-4f56-b981-51364bb9d405","resolution":{"observed_at":"2026-08-07T00:14:43.751576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15646","last_updated":"2025-05-21T15:24:29Z","snapshot_observed_at":"2026-08-19T22:56:04.029080Z","submitted_at":"2025-05-21T15:24:29Z","title":"Word Level Timestamp Generation for Automatic Speech Recognition and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15646","snapshot_observed_at":"2026-08-07T00:14:43.788931Z","title":"Word level timestamp generation for automatic speech recognition and translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.788931Z"},"links":{"cited_paper":"/paper/2505.15646","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:9fe09044a35affabc8710112972b405dd07c9bd93e4277d189a37bf414ced2bd","observation_id":"4ccfcd34-cce5-4033-b454-67182e2d72ec","resolution":{"observed_at":"2026-08-07T00:14:43.788931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:43.865086Z","title":"python-pinyin: pypinyin, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.865086Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:7fd5f1973a2b1ceb9513d6e4be5f7753eba35aab85a13223dd5679dee302dbb3","observation_id":"9abdc930-d034-4b06-b470-9efcf5667b65","resolution":{"observed_at":"2026-08-07T00:14:43.865086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16381","last_updated":"2025-06-19T15:08:01Z","snapshot_observed_at":"2026-08-16T17:50:48.232882Z","submitted_at":"2025-06-19T15:08:01Z","title":"InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16381","snapshot_observed_at":"2026-08-07T00:14:43.938774Z","title":"InstructTTSEval: Benchmarking complex natural-language instruction following in text-to-speech systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.938774Z"},"links":{"cited_paper":"/paper/2506.16381","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:893bc90efc457778db82c937bba11f8172858cd1f0fd2953fe5692abbb1a31a3","observation_id":"8ad53429-5f47-4f33-9b3a-5a55b1bb9063","resolution":{"observed_at":"2026-08-07T00:14:43.938774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:44.013468Z","title":"MOSS-VoiceGenerator: Create realistic voices with natural language descriptions.arXiv preprint arXiv:2603.28086, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.013468Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:b4d5772f157a2f4da842be410a6d04d8a218f2e75fae1da6a7c76a715de51dcc","observation_id":"cfba38d7-261f-471b-8c81-8e48249828ab","resolution":{"observed_at":"2026-08-07T00:14:44.013468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:44.072588Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to-speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.072588Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:ba14dd04ebcc73ad17153415a88752b7816ab83cbe14174520618167438f3ce8","observation_id":"f76e05c2-caee-4bb0-833f-acfcd4c9bf27","resolution":{"observed_at":"2026-08-07T00:14:44.072588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:44.128295Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.128295Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:0cb5a08b6b34cc283b35980914aea3db2943203fb9e9f07fb9493edda22d1d14","observation_id":"4f142beb-f802-45d1-952f-0c0e75de527d","resolution":{"observed_at":"2026-08-07T00:14:44.128295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-07T00:14:44.188454Z","title":"Categorical reparameterization with gumbel-softmax.arXiv preprint arXiv:1611.01144, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.188454Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:0c7037c5688b514fa96599079e92522e44ef71d312e8b2868c63a2f20bc3ea75","observation_id":"8bd961c4-c379-4c63-bc1a-f899dad96973","resolution":{"observed_at":"2026-08-07T00:14:44.188454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07889","last_updated":"2021-06-15T05:35:34Z","snapshot_observed_at":"2026-08-17T20:24:31.954061Z","submitted_at":"2021-06-15T05:35:34Z","title":"UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07889","snapshot_observed_at":"2026-08-07T00:14:44.291965Z","title":"Univnet: A neural vocoder with multi- resolution spectrogram discriminators for high-fidelity waveform generation.arXiv preprint arXiv:2106.07889, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.291965Z"},"links":{"cited_paper":"/paper/2106.07889","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:f26916313fa629eb8a9dd8549ae7502fe724b29d6c84742feb8cc0092a065023","observation_id":"de7de596-658d-464a-afbe-8d5945ac41c2","resolution":{"observed_at":"2026-08-07T00:14:44.291965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-16T13:22:55.356873Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-07T00:14:44.413014Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.413014Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:47b1de0252c41524540f00914c474570770770eaa920b04f5a475c29062c93ad","observation_id":"65bf9d44-5877-453f-a5c2-dbfd4a626359","resolution":{"observed_at":"2026-08-07T00:14:44.413014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:44.516351Z","title":"Latent-domain predictive neural speech coding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.516351Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:880afedd448ab587dd4aa53c239afe1ecb880f7b1608517819689f0ee4db5933","observation_id":"145311e9-5980-45c6-83c6-68dd594e8f83","resolution":{"observed_at":"2026-08-07T00:14:44.516351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:44.603836Z","title":"Mega-tts 2: Boosting prompting mechanisms for zero-shot speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.603836Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:2b43aa0eab4dc3ee83bfbeaa7e6b98aa554df2bb13da0bcbbe6db91da86d1f6d","observation_id":"f1d65616-ac24-4a57-9f4f-cfd2485a6be1","resolution":{"observed_at":"2026-08-07T00:14:44.603836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-16T12:55:06.202467Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T00:14:44.716159Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.716159Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:beeb64b4f785dbfd5d6c6ac09c257089c1c14daae534b8e473d4cfd5c55b538d","observation_id":"bf3d068e-ceb0-4675-abbf-063188f005fa","resolution":{"observed_at":"2026-08-07T00:14:44.716159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14345","last_updated":"2025-03-19T07:17:41Z","snapshot_observed_at":"2026-08-19T02:01:24.675891Z","submitted_at":"2025-03-18T15:25:08Z","title":"MoonCast: High-Quality Zero-Shot Podcast Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14345","snapshot_observed_at":"2026-08-07T00:14:44.813923Z","title":"Mooncast: High-quality zero-shot podcast generation.arXiv preprint arXiv:2503.14345, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.813923Z"},"links":{"cited_paper":"/paper/2503.14345","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:69450258adf04e8561a8dab7d0c84e7669f91d1a58185b19fccb0b01f4b0ed7e","observation_id":"913701e3-7d01-4e72-8f4d-9caa3d9c1a73","resolution":{"observed_at":"2026-08-07T00:14:44.813923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:44.915123Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.915123Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:b8d91d0e499eaed62f8ce14130e9e63b064eaf55f1eee9ec69d685b4abcff334","observation_id":"3aee4add-7bbf-4338-8bcb-e00b8f05c8a9","resolution":{"observed_at":"2026-08-07T00:14:44.915123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:45.013023Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.013023Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:298113d18f5d4f9aee63ea8f7edf09e750d80a745dda88e5fe933476caacc377","observation_id":"2372d0f5-d560-4c5a-a9f2-25412638214b","resolution":{"observed_at":"2026-08-07T00:14:45.013023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:45.110663Z","title":"Best-worst scaling more reliable than rating scales: A case study on sentiment intensity annotation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.110663Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:93ab3a9e16fab21b22be2675564e719f0e12e12d904d42e8f89298a5c92a46bd","observation_id":"36bcbb4a-06ce-49ff-8ac1-e50046674a45","resolution":{"observed_at":"2026-08-07T00:14:45.110663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:45.209549Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis.Advances in neural information processing systems, 33:17022–17033, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.209549Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:550d2ce8729bd3670b88e0b3938908658ce3afd9e38c3a7739558a717e3e6b8b","observation_id":"31010d63-83be-4fe6-a15e-d470da4b3634","resolution":{"observed_at":"2026-08-07T00:14:45.209549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1993.40720","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:52.550115Z","title":"Kubichek","venue":null,"work_id":"ed7defe8-7161-41fd-8e8c-b947f613a1fe","year":1993},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.299385Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:8d00853e236572f9201ae55da8ccbfd94c8cea25fb9cfe91cf1d7da57feed8ba","observation_id":"3a0e8681-68a2-4b02-8ca6-9a95ba03e568","resolution":{"observed_at":"2026-08-07T00:14:52.634038Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:45.422509Z","title":"Torchaudio-squim: Reference-less speech quality and intelligibility measures in torchaudio","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.422509Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:55ad6c224c054523f23fafb4e70beb3e9adf5f30493a58b6acf9abc78b40254f","observation_id":"89fb67de-fd30-4c14-b4fc-fa250198c48f","resolution":{"observed_at":"2026-08-07T00:14:45.422509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06546","last_updated":"2023-10-26T22:17:49Z","snapshot_observed_at":"2026-08-17T04:17:14.863621Z","submitted_at":"2023-06-11T00:13:00Z","title":"High-Fidelity Audio Compression with Improved RVQGAN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06546","snapshot_observed_at":"2026-08-07T00:14:45.767421Z","title":"High-fidelity audio compression with improved rvqgan.arXiv preprint arXiv:2306.06546, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.767421Z"},"links":{"cited_paper":"/paper/2306.06546","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:c42f8a334909a40775edf8091d7cccde6558bc01bbc2479851ba6cd9ab0f9abc","observation_id":"59066311-494b-4bd7-b822-fd5f4f5b1025","resolution":{"observed_at":"2026-08-07T00:14:45.767421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:45.897887Z","title":"Parler-TTS.GitHub repository, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.897887Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:d49bc606472f11574bcb9d7fba3a04676c836587bb700e47b1a5cfe42199cd5a","observation_id":"274b58e5-e371-4c0c-bf41-58c2f4508c73","resolution":{"observed_at":"2026-08-07T00:14:45.897887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:45.972331Z","title":"Towards streaming synchronized spatial audio generation via autoregressive diffusion transformer","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.972331Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:aa5c3bb145f4df85e6029e04bb2fb8f2e7af207d679cc991b8314300bc1a4e0b","observation_id":"5d9dbd49-c119-4d3b-b0cf-76080032ac4d","resolution":{"observed_at":"2026-08-07T00:14:45.972331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09940","last_updated":"2024-06-03T17:33:25Z","snapshot_observed_at":"2026-08-18T15:16:54.735177Z","submitted_at":"2024-05-16T09:43:40Z","title":"Robust Singing Voice Transcription Serves Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09940","snapshot_observed_at":"2026-08-07T00:14:46.067633Z","title":"Robust singing voice transcription serves synthesis.arXiv preprint arXiv:2405.09940, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.067633Z"},"links":{"cited_paper":"/paper/2405.09940","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:59b2dcb3d2faf0e5a79abffc06c49f8d681d9c7f2ee0ab9bdd9c0622a7931856","observation_id":"64f66b5f-a00e-4e28-b50c-be9cec58a48d","resolution":{"observed_at":"2026-08-07T00:14:46.067633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"cited_work":{"arxiv_id":"2605.30993","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30993","snapshot_observed_at":"2026-08-07T00:14:52.278427Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","venue":"eess.AS","work_id":"4dbe42e9-1b39-4d6e-98d7-fbcc44cf71d2","year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.125240Z"},"links":{"cited_paper":"/paper/2605.30993","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:ce04cdf5c30ba8a51d6476c7d480f985b8c74854dc305e10c1da51be8db5828a","observation_id":"f35ae698-ac55-4c9a-a820-2a26e6f09cd4","resolution":{"observed_at":"2026-08-07T00:14:52.340147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:46.222847Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.222847Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:8a089a85fa7bdf70426dd84c51b58f13f9ef651863550b1944efb61dcee12876","observation_id":"a4190413-a002-4726-96a9-ee972d6a1490","resolution":{"observed_at":"2026-08-07T00:14:46.222847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:46.318767Z","title":"UniMoE- Audio: Unified speech and music generation with dynamic-capacity MoE.arXiv preprint arXiv:2510.13344, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.318767Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:f6755263546ec1ed4607522ea6f1a015f189f617f193f05e9de17c8883e4fa13","observation_id":"f24b2542-123b-447a-a743-6345e1ce0e7a","resolution":{"observed_at":"2026-08-07T00:14:46.318767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:46.430188Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.430188Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:e0c55202fcbdc8ed159a78d46493181cd9e504eb6c4ee06b42fcc3345fd90019","observation_id":"48989418-7daa-453e-99e1-7a3eebd4211b","resolution":{"observed_at":"2026-08-07T00:14:46.430188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-16T14:21:59.601701Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T00:14:46.524756Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.524756Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:b012bf7ce36964f1536f3bf3890a6b69e72d3ad4afc9ca4d899af58e9ea8c2b3","observation_id":"d33c18b7-0caa-4bd3-9a9e-2e5011ebca0f","resolution":{"observed_at":"2026-08-07T00:14:46.524756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:46.600213Z","title":"MOSS-TTSD","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.600213Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:caeb427edc9db07aeeff418fb4aafd9e6776ef076bdc8bad6e9c1b0c69790189","observation_id":"f5bb9fd7-b8dd-44bc-9ec0-195f0b295945","resolution":{"observed_at":"2026-08-07T00:14:46.600213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T00:14:46.711486Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.711486Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:c150e7814de3f8a1e4c7257b9f54e891df60e2471f5ae92960bc1175f74774e4","observation_id":"528e3f56-ed6d-458b-8d18-2d5f0e93ab3e","resolution":{"observed_at":"2026-08-07T00:14:46.711486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:46.787489Z","title":"A multimodal evaluation framework for spatial audio playback systems: From localization to listener preference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.787489Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:f14435b8d06387561afc6c6bc7780d3d5d473f5835166c660b508d9854c31a22","observation_id":"0397d39e-6d29-4f14-96eb-005d53cb285a","resolution":{"observed_at":"2026-08-07T00:14:46.787489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-18T07:30:52.697166Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"cited_work":{"arxiv_id":"2606.23139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23139","snapshot_observed_at":"2026-08-07T00:14:51.965614Z","title":"Audio Editing in the Era of Foundation Models: A Survey","venue":"eess.AS","work_id":"88f10a97-560b-42b8-88d9-935fcdc323f6","year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.893801Z"},"links":{"cited_paper":"/paper/2606.23139","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:df6fc4d29e2ae8c79a6e503ecd4fa766c9c3e7286b8efea2d5b30c99a3631485","observation_id":"131edcb5-940e-44b9-96ce-f9d35819cbee","resolution":{"observed_at":"2026-08-07T00:14:52.074519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2605.28618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.28618","snapshot_observed_at":"2026-08-07T00:14:51.684270Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","venue":"eess.AS","work_id":"34e5c9dc-9302-43b8-8d97-f2fe01da33e3","year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.946227Z"},"links":{"cited_paper":"/paper/2605.28618","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:34a4e24d8dd7410045eca6b494dff0ffb2f671a55ee3a3d7a61be3c8df3b1d9b","observation_id":"26b3406d-42d4-44ca-bf3e-58a62695a12e","resolution":{"observed_at":"2026-08-07T00:14:51.835378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:47.015110Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.015110Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:c661fc25d05db730b020984ed273ae5bf927d3ff5a3acef4f0cb051764c16110","observation_id":"ac8b1340-c8f1-4778-87e3-5c8b05add0ea","resolution":{"observed_at":"2026-08-07T00:14:47.015110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-21T04:02:28.386179Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-08-07T00:14:47.082431Z","title":"Same: A semantically-aligned music autoencoder.arXiv preprint arXiv:2605.18613, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.082431Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:fb57283fd3f645a6781dfcdc514efe3393488be804b7b9c5f3ecd9a1dc758e35","observation_id":"7cecd235-87b3-40c3-8f52-32a819df9aab","resolution":{"observed_at":"2026-08-07T00:14:47.082431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:47.166984Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.166984Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:06f7e583bc3ef00124c3e0525b7968f6cd79f5f9db4a4b96a6d9d546dbf2cf72","observation_id":"85f2379a-1267-444b-ae27-72f2a45d69cd","resolution":{"observed_at":"2026-08-07T00:14:47.166984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-08-15T16:51:35.217742Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-07T00:14:47.221328Z","title":"Vibevoice technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.221328Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:24d7887198bedd647f09e6e8f16317180d593a8d77b8109d701d84ba57e90f9a","observation_id":"b72284d2-4250-44f5-b7c9-cbabb5aba932","resolution":{"observed_at":"2026-08-07T00:14:47.221328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-07T00:14:47.314501Z","title":"Qwen3-TTS technical report.arXiv preprint arXiv:2601.15621, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.314501Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:8b75b0752833382644abc8706ad9031244517437cf44638cf0f51c024ce14296","observation_id":"8fe2f0d6-c32e-4975-87b4-98fba54c03ec","resolution":{"observed_at":"2026-08-07T00:14:47.314501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:47.388246Z","title":"Nemo forced aligner and its application to word alignment for subtitle generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.388246Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:9d7a35ecb8b0ca0160b376bc43d830afe9015ecffd343500573ca751203d10fa","observation_id":"70c51ebe-666a-45fd-ab12-5885f1515156","resolution":{"observed_at":"2026-08-07T00:14:47.388246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:47.480628Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.480628Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:eabcd76701c3b9ab5a3717ecd003f610ed891bd073ec17208c59a0150d2d4256","observation_id":"a87082ea-d441-4166-be99-8a6cc1be3a89","resolution":{"observed_at":"2026-08-07T00:14:47.480628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:47.571640Z","title":"OV-InstructTTS: Towards open-vocabulary instruct text-to-speech.arXiv preprint arXiv:2601.01459, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.571640Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:9161b1e892244065cb61ab1aed21e2edd2e592aae2892ff1bae9b98d7634723a","observation_id":"0857a230-ecd5-4c80-aacf-0b37d099e946","resolution":{"observed_at":"2026-08-07T00:14:47.571640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:47.640432Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.640432Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:a0ab31a6c0668057b3ffcbac78a9b870adf48162301ad406660e7b8fbefc428d","observation_id":"bb35624b-16cb-42de-b677-ebf4912623bf","resolution":{"observed_at":"2026-08-07T00:14:47.640432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:14:47.719103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.719103Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:dca9143fb143fa14a7a697e38eac398c027a97f5e558861b798a559b72fd2f02","observation_id":"7e388abd-9eed-4c5f-bef9-13498a556294","resolution":{"observed_at":"2026-08-07T00:14:47.719103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-16T15:39:31.485174Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-07T00:14:47.793573Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers.arXiv preprint arXiv:2304.09116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.793573Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:37db1d38a24d07c4a357b94171f6201b2e63438eaf902fc3e212f9e1e648122f","observation_id":"265648e2-a0c1-4985-8af3-e4ba1b4ce885","resolution":{"observed_at":"2026-08-07T00:14:47.793573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-18T07:28:07.590809Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T00:14:47.871653Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.871653Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:58b3e5032753b4bc07951457d07071c5d824d4b0a0c03c2225f107d657518f3e","observation_id":"a95b1244-7755-434f-a7bb-b75e33b5c60f","resolution":{"observed_at":"2026-08-07T00:14:47.871653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14831","last_updated":"2025-06-06T23:43:53Z","snapshot_observed_at":"2026-08-17T16:18:28.555798Z","submitted_at":"2025-02-20T18:45:44Z","title":"Improving the Diffusability of Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14831","snapshot_observed_at":"2026-08-07T00:14:47.940224Z","title":"Improving the diffusability of autoencoders.arXiv preprint arXiv:2502.14831, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.940224Z"},"links":{"cited_paper":"/paper/2502.14831","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:3dc8bf9932e09c18cce125e07bc2bfa47f622a0b00f0a4379610e82e80804eb0","observation_id":"5dd704b5-fe2f-401b-9b97-bb112eec6049","resolution":{"observed_at":"2026-08-07T00:14:47.940224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:48.024601Z","title":"The 2018 signal separation evaluation campaign","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.024601Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:fdac58e5c80ee432658e38fabbcce40b1629ccbb9cfaf20cf472cb48f8ac8d63","observation_id":"c175b092-2a48-4944-b38b-757f4ae97ea6","resolution":{"observed_at":"2026-08-07T00:14:48.024601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:48.098240Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech.IEEE Transactions on audio, speech, and language processing, 19(7): 2125–2136, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.098240Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:a08559b7456969f748379811558a496e024bfcd3ac0db4203c2de00b38819219","observation_id":"1db877a3-803c-4a61-bfc3-812b220892e1","resolution":{"observed_at":"2026-08-07T00:14:48.098240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-07T00:14:48.166617Z","title":"Seedance 2.0: Advancing video generation for world complexity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.166617Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:74d99e847733d63153516a727336937fdd1a24f983b66b4de8c190a5b6a94441","observation_id":"5326b022-af52-4660-bbc9-502176ebfb76","resolution":{"observed_at":"2026-08-07T00:14:48.166617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-12T18:07:30.628246Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.23190","snapshot_observed_at":"2026-08-07T00:14:48.234028Z","title":"Flowtts-grpo: Online reinforcement learning with multi-objective reward optimization for flow-matching based text-to-speech","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.234028Z"},"links":{"cited_paper":"/paper/2606.23190","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:663b337c3bb6e6d907a02aac451faa3b4f50c2581502cbff38da62364b997489","observation_id":"d9facae7-a25b-4d97-bbf6-c3f310d05aae","resolution":{"observed_at":"2026-08-07T00:14:48.234028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-18T03:47:39.333317Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-07T00:14:48.305543Z","title":"Cam++: A fast and efficient network for speaker verification using context-aware masking.arXiv preprint arXiv:2303.00332, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.305543Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:fca5a2ba8185e8703f3e56feca452c572dd18f148c1756d2e5467b5970fb8fca","observation_id":"dde9d30c-28e3-48db-bfa2-a2f7981db857","resolution":{"observed_at":"2026-08-07T00:14:48.305543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-15T04:59:51.918109Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-07T00:14:48.376493Z","title":"Auxiliary-loss-free load balancing strategy for mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.376493Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:749bd5aa41e5fc7d4ed4467b09ae444b40e2a4faf40b3a4a8cb299bc38a8a9d6","observation_id":"b45fb951-7073-44ac-a50a-849f3e67cf70","resolution":{"observed_at":"2026-08-07T00:14:48.376493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-20T01:09:59.849605Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-07T00:14:48.455337Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.455337Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:4c6046f4c6bf2e374c6fbe745935fd0a76e47e9fa4f9f255c8cd9042995bef3b","observation_id":"c9cabb25-a778-4980-9293-5f01de63f73c","resolution":{"observed_at":"2026-08-07T00:14:48.455337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:48.549099Z","title":"Soulx-podcast: Towards realistic long-form podcasts with dialectal and paralinguistic diversity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.549099Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:dbf86536aac78def834afa179acf98556dff4b9289b69781ad6a5b60d34d4512","observation_id":"c59ab591-ccf8-488e-80f9-9d7ac157491b","resolution":{"observed_at":"2026-08-07T00:14:48.549099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-15T08:18:32.827110Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-07T00:14:48.608557Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot.arXiv preprint arXiv:2509.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.608557Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:cf4d855e21b65c7ee0dce6b435874314c0d246b93e39fa105054051e8d6fae23","observation_id":"fc61158c-106d-4638-89d6-178270575d88","resolution":{"observed_at":"2026-08-07T00:14:48.608557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:48.682385Z","title":"Secap: Speech emotion captioning with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.682385Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:057c1f56643adb6860808e61f770136b000946f439fc745fffba8968e486a1d3","observation_id":"bbc6b733-63c5-4f8b-85b2-a6837ba82714","resolution":{"observed_at":"2026-08-07T00:14:48.682385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:55.586475Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92), 2019","venue":null,"work_id":"a1af15e1-805b-42f1-a462-1001ea4bb5e2","year":2019},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.748834Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:08b31a4aca27c6073c7f16b3f792c796c61345ae8ec660437a5fd53ca1480385","observation_id":"3e934298-5e24-4464-893f-e74432a7a2e8","resolution":{"observed_at":"2026-08-07T00:14:55.631663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T00:14:48.819903Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.819903Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:9da9e2cc787e54b1667dcb46501d329125359fef9572a78c068d53d5984d5c84","observation_id":"2bae1a7d-e835-4a69-95b2-ea307491fa90","resolution":{"observed_at":"2026-08-07T00:14:48.819903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:55.477496Z","title":null,"venue":null,"work_id":"6ef2fffc-372e-4481-8f9a-60b3add85894","year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.916590Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:8703e61e2c1bfd37d63ba8444d2d6e3f15b986619bb24a337cd40dfeda7f5938","observation_id":"1619c124-c65d-48d3-ac09-b57a83db686b","resolution":{"observed_at":"2026-08-07T00:14:55.528938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T00:14:49.016529Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:49.016529Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:7aa6e0010cc98e5ea9ccda547e75113a4ca4ffdd86f9521b7ca829c31f85fe58","observation_id":"bcd2f08e-ee7f-4ed1-b3c2-e482f20237cf","resolution":{"observed_at":"2026-08-07T00:14:49.016529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:55.385379Z","title":"Weiss, Ye Jia, Zhifeng Chen, and Yonghui Wu","venue":null,"work_id":"731ba1db-b342-42c8-96c0-a9af98bc4195","year":2019},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:49.125255Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:c69472d8d503f91e5b7da5ef21540f48b9b5b17fb5369445890485f486cfb027","observation_id":"10357896-112d-4d39-bf8e-1e6cb590b7d1","resolution":{"observed_at":"2026-08-07T00:14:55.429260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:55.278208Z","title":"Zezario, Szu-Wei Fu, Chiou-Shann Fuh, Yu Tsao, and Hsin-Min Wang","venue":null,"work_id":"a162e947-6e60-44c0-be6c-3964ca1e5ac4","year":2020},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:49.220696Z"},"links":{"citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:2bc640814bcb6735d5a62c203160c6f300ef90a5235237f4750d2e02646a5f35","observation_id":"6cb030b0-22d5-417f-8608-fd026805c0db","resolution":{"observed_at":"2026-08-07T00:14:55.322898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":91,"verified_exact":4,"verified_fuzzy":3},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 0 inbound Pith citation observations for arXiv:2608.02023."}