{"as_of":"2026-08-08T21:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59405cb13dd077ad3fb550f0d5b6bdeec0c24f48850781d140dcf4877f331650","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:17.839718Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:15.143902Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:07:35.840013Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-08-07T15:23:15.143902Z","title":"The text encoder tokenizes input text into fine-grained sequences, and in some cases, further transforms them into high-dimensional se- mantic representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.143902Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:d9bdb3fa3f40b33700e3026649ec79e06a4b8b108e4d4b71cd335b3748e14da6","observation_id":"24a1e843-44d3-47ad-8717-7485443a8ae8","resolution":{"observed_at":"2026-08-07T15:23:15.143902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2505.15380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-07-03T03:07:35.840013Z","title":"Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, and Jie Zhou","venue":null,"work_id":"7807d459-f543-40c3-90d2-b2810050f636","year":2025},"citing_paper":{"arxiv_id":"2603.04592","last_updated":"2026-04-19T16:23:58Z","snapshot_observed_at":"2026-08-03T02:05:46.790260Z","submitted_at":"2026-03-04T20:37:30Z","title":"From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T16:16:15.819622Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2603.04592"},"observation_digest":"sha256:90c4cdefd7d9d1008c38cb3664aa51d25359a438950746d6a568d2f5afb1e7c6","observation_id":"604113b4-449c-4a4e-96fe-878d568fd995","resolution":{"observed_at":"2026-05-15T16:20:09.985065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2505.15380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-07-03T03:07:35.840013Z","title":"Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, and Jie Zhou","venue":null,"work_id":"7807d459-f543-40c3-90d2-b2810050f636","year":2025},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:a6bd516d0814b3ccb72cbff0c5f598f3ee06259ae3408875aa6c3137179cee91","observation_id":"21d9457d-92a3-4e8f-b128-efbb9d054d0e","resolution":{"observed_at":"2026-07-03T03:07:35.841608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15380/citation-record","integrity":"/paper/2505.15380/integrity","json":"/paper/2505.15380/citation-record.json","paper":"/paper/2505.15380"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-08-07T15:23:15.143902Z","title":"The text encoder tokenizes input text into fine-grained sequences, and in some cases, further transforms them into high-dimensional se- mantic representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.143902Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:d9bdb3fa3f40b33700e3026649ec79e06a4b8b108e4d4b71cd335b3748e14da6","observation_id":"24a1e843-44d3-47ad-8717-7485443a8ae8","resolution":{"observed_at":"2026-08-07T15:23:15.143902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:20.282022Z","title":null,"venue":null,"work_id":"fcc687fd-4775-4ff5-8f88-f351ff2a3717","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.251633Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:7d272c670d42fd3b8a05dae691d2a6e13e4c093c24086f9d23fec2c581f76985","observation_id":"872514fb-4d98-49e1-b55c-dc839c255d33","resolution":{"observed_at":"2026-08-07T15:23:20.322728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:20.162898Z","title":"Implementation Details We use CosyV oice 2 [5] as the target model, which is a highly efficient TTS model consisting of 24 layers of Transformer adapted from Qwen2.5 (0.5B) [28]","venue":null,"work_id":"966b5ee3-2ca7-4aad-b858-24b0d593512a","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.340413Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:4400bd838771277ba7c1480a8d8914186d154a2a2e37c9d986ab12de124697f9","observation_id":"c9abe58f-1ca2-4bb9-9030-9ceffc84b2af","resolution":{"observed_at":"2026-08-07T15:23:20.207630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:20.032368Z","title":"train-clean-100","venue":null,"work_id":"83cf15cf-8e52-4c77-93cc-3a1ea6f27c01","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.389309Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:a97ee79257177ea6066818201e9b58904794d98df9617f016c768a9bc41c73e0","observation_id":"10d1f27b-e487-43a9-a148-445c0eb55121","resolution":{"observed_at":"2026-08-07T15:23:20.077043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.912042Z","title":null,"venue":null,"work_id":"c2158339-67ec-4049-b5ba-0230b93c4a7c","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.452371Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:cce8ca8d5642a677d244025b75f3c4216c945a2ccd2a88dba7ca0c7f744c39fe","observation_id":"db1db276-7d3c-46cd-a6a8-faf31224f583","resolution":{"observed_at":"2026-08-07T15:23:19.959504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.785052Z","title":"We propose a lightweight draft model constructed by fine- tuning a few parameters from the target model","venue":null,"work_id":"4347de05-a42c-45e0-a42a-1ecd666da6a6","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.507290Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:e8abf030cc463a57abb681110d4d628e38910bd2be106e56ce881c0bca1b6845","observation_id":"33f18f76-31ce-491f-83c9-11ec38c10b5a","resolution":{"observed_at":"2026-08-07T15:23:19.855401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:15.551203Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.551203Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:40795ea3e36605145d63a09f35eaf1dd0ae69ccd0482958ae9d4e3dcce8b015e","observation_id":"3c42f3aa-6462-4a62-bcbd-6ad8ddce9fe4","resolution":{"observed_at":"2026-08-07T15:23:15.551203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:23:15.575777Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.575777Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:160f5f06c783990b6f1e58c865b00a688c79569b251d72a8a594ab6d2591c706","observation_id":"9b69b132-0295-4655-a468-effbb30fa8e2","resolution":{"observed_at":"2026-08-07T15:23:15.575777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T15:23:15.604779Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.604779Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:1ac02c026981a0da387d1099b0730c06370fb32d9152118803b90ed3497229e2","observation_id":"64fe4a74-6347-4730-9265-6015099d6104","resolution":{"observed_at":"2026-08-07T15:23:15.604779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T15:23:15.641196Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.641196Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:e9255c98b9aa2f0d67ea865d8802079d2ea27e3fccc3125db7d7fb6ab32ecf0a","observation_id":"ca8bfa3e-ec9a-44ad-b667-1584f0572553","resolution":{"observed_at":"2026-08-07T15:23:15.641196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T15:23:15.731823Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.731823Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:46fe0fb59f165b5e9808dec3b4b334567da4d703db6118677ae4cb9665d8e9b7","observation_id":"b4e28ec6-9b36-419d-98bc-e27196d76e11","resolution":{"observed_at":"2026-08-07T15:23:15.731823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T15:23:15.777675Z","title":"Cosyvoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.777675Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:8bf0f0ee3eaf050485ddf3bd4de9cf0f9b292479218cea338b55645a9242f49c","observation_id":"5cb08c7b-a74c-4ae4-a7ba-6089eeb595af","resolution":{"observed_at":"2026-08-07T15:23:15.777675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T15:23:15.813372Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.813372Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:12e9a07b608acf499a8855e1df0ee6c94715b65ac3400998be6c27a8c3fc95df","observation_id":"d8383ff8-ddd2-4fd7-8b0c-546f08809e16","resolution":{"observed_at":"2026-08-07T15:23:15.813372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T15:23:15.859744Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.859744Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:dc836aa493366b035824060a6cae59411d5354eda16b3c9832f05dab79c178b2","observation_id":"6ba236b4-77cf-483f-80a7-d4709efe4c0d","resolution":{"observed_at":"2026-08-07T15:23:15.859744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.656455Z","title":"Speak, read and prompt: High-fidelity text-to-speech with min- imal supervision,","venue":null,"work_id":"fe9a12a9-f917-4c23-8e42-eb6a201d3acf","year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.956802Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:0e1a61755d32c939c137eb064f384a7d9650f572b11b3fc12d577d8caf7ecf72","observation_id":"0f465032-5e78-48ef-a896-195465f89196","resolution":{"observed_at":"2026-08-07T15:23:19.709640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T15:23:16.017706Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.017706Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:0f6735ed39072350b2f392515f5d6f314cf80d9cc42fe4f7d87c69e4e1e06617","observation_id":"3cff66e8-7686-4e37-902f-7bfdff761efa","resolution":{"observed_at":"2026-08-07T15:23:16.017706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.444877Z","title":"VoiceCraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"f1cf76b7-f8ce-4151-80ca-11e5bae9f377","year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.073254Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:3c6f9d681673a90d696c441e2604e45510b9863579f1482da6684900e638e0c5","observation_id":"3468eeba-dae0-47ae-b1a0-87c518360087","resolution":{"observed_at":"2026-08-07T15:23:19.586294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T15:23:16.151902Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.151902Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:d11b2be02bb5146234e2e13034adadbce59afeed19c8fcbbc4452c2d8e5f1f09","observation_id":"6c5afbac-e9d2-4862-8f5f-cab96a22e33d","resolution":{"observed_at":"2026-08-07T15:23:16.151902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.203599Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.203599Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:4f1181dd36f1e4346983692a93e3bc270de90401f2c1f7a345d92b7d4be8815a","observation_id":"a96e4fd3-69c0-4ab7-a063-bf77ecc4dab8","resolution":{"observed_at":"2026-08-07T15:23:16.203599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.281099Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.281099Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:54d9c68d0d4f1ffecfa6b0cbde24390c00fa5e223390c1dd7a1d739c5814bf0c","observation_id":"c9f75ea3-9fc1-4e6a-8739-017b35a216f1","resolution":{"observed_at":"2026-08-07T15:23:16.281099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.349834Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.349834Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:fdfaf7e76ec8ab73a141df546578e422afa9d7e14a37b911217a6aa3ee405e52","observation_id":"89ddf565-d73b-4efd-97b4-1068b845d91e","resolution":{"observed_at":"2026-08-07T15:23:16.349834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.414472Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.414472Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:ea7600b00aa2b8bc56d36761279aa34f04189cd6104aa93ffd81b6615f46ced0","observation_id":"d701b6bc-99c1-4a21-a74d-12fe62439679","resolution":{"observed_at":"2026-08-07T15:23:16.414472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.481026Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.481026Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:21ab9218b30499aaa1817d7b05f04fd6e0e0976e4cdb6a8e7c581c9139a442fc","observation_id":"487eff77-b90a-407b-9ddb-4ad995b087d2","resolution":{"observed_at":"2026-08-07T15:23:16.481026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.568587Z","title":"Vits2: Improving quality and efficiency of single-stage text-to-speech with adversarial learning and architecture design,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.568587Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:bba3d2afb20c3f54ba1379db23015eb08f6a39bcf21361e0aecf1be69d56aff6","observation_id":"470d2aea-2acf-4d9f-8e6e-a118df1b37ba","resolution":{"observed_at":"2026-08-07T15:23:16.568587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T15:23:16.617519Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.617519Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:3166d4edb8083b170d8bf263906fc7e3a16a2add2a39dd61b57c3c12e4726a8f","observation_id":"7e9d3fe9-a6cf-4a45-9a8f-3ca81cfaf868","resolution":{"observed_at":"2026-08-07T15:23:16.617519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-07T15:23:16.693219Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.693219Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:2bd9fe3d6aabf61ffba974717714e6d36afc20960853d9bfb90a2b5f491e84b4","observation_id":"3d0cc4b9-8fbd-42a0-85b2-d587cbc04dad","resolution":{"observed_at":"2026-08-07T15:23:16.693219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.781575Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.781575Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:e5bc880e16e55aeadc72e041041bd1553916133a6cf80d9f5a8d36bdf289419f","observation_id":"197fe7f3-9c56-4e98-896f-ecffdbbe174e","resolution":{"observed_at":"2026-08-07T15:23:16.781575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.886672Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.886672Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:1682631d339b15d2bd258e1bd7f90abde99a3b3fd0d831e6400cc9ad2df92fbe","observation_id":"d5181814-bea1-419c-a700-9e0471be7a48","resolution":{"observed_at":"2026-08-07T15:23:16.886672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T15:23:17.015468Z","title":"Accelerating large language model decoding with speculative sampling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.015468Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:74cf1fe418dc82ceb1ff20975ec2d80c60f8dbb6b21f1efe67c7024968bf9c8b","observation_id":"e62cdb9c-53a5-4ab2-a29a-da9d01cecb95","resolution":{"observed_at":"2026-08-07T15:23:17.015468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:17.116127Z","title":"Fast inference from transformers via speculative decoding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.116127Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:15534591b93e289be5d743f6577115021afa4627295e20dd3c9a9a70aaf60fad","observation_id":"3f8448db-da43-45bd-8af1-f70057db5367","resolution":{"observed_at":"2026-08-07T15:23:17.116127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.107192Z","title":"Accelerating codec-based speech synthesis with multi- token prediction and speculative decoding,","venue":null,"work_id":"65742b51-9434-4332-8966-29bb3c021a77","year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.237630Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:c63158b2b83885b6a5d20f751d3545972c3e6d8eff807e8430da5f042a71f7c8","observation_id":"6d462931-f02b-46b1-8917-3aa7eab461fd","resolution":{"observed_at":"2026-08-07T15:23:19.182314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:18.848731Z","title":"Fast and high- quality auto-regressive speech synthesis via speculative decod- ing,","venue":null,"work_id":"060e9f99-3f50-438d-a9d6-c861bf4d05ee","year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.345738Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:0f392810c77d340250df0dc1412999556bb0d23ede3b8d846e0d458c8dae389b","observation_id":"5d031e44-2e1a-4046-9a31-3445e80e2638","resolution":{"observed_at":"2026-08-07T15:23:18.969777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:17.482133Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.482133Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:2cc5d9c4574902502cd72d62c3c82515e63dacbc0d3cc098c89ba262cebbae65","observation_id":"d0629482-ebf6-4d76-95d3-6b775180c0b9","resolution":{"observed_at":"2026-08-07T15:23:17.482133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:18.506296Z","title":"Efficient adapter transfer of self-supervised speech models for automatic speech recogni- tion,","venue":null,"work_id":"7f72ee7e-5d59-4d4f-9e6c-dd6e25f1a2a5","year":2022},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.592839Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:cbba1bc2f1720969cc854ee242af31aeb0bf4f473906ccf5fa7a0e25e698e8ab","observation_id":"99a912a4-5304-4ad4-999c-7f8e935d24d8","resolution":{"observed_at":"2026-08-07T15:23:18.640010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:23:17.675437Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.675437Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:06129bfd9ac5555a096bbf825e0cee22c72c465f97b9a00d18b21c0653f03a47","observation_id":"a8cae2a1-88b7-4f1b-b646-e638af413132","resolution":{"observed_at":"2026-08-07T15:23:17.675437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T15:23:17.733722Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.733722Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:833354009c468c9c282f29fcc37fcedb40dd7f0c3abc1429c6cec038c644306d","observation_id":"9406f94a-5627-4515-a080-dbe4ed64e775","resolution":{"observed_at":"2026-08-07T15:23:17.733722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:18.277519Z","title":"Unicats: A unified context-aware text- to-speech framework with contextual vq-diffusion and vocoding,","venue":null,"work_id":"540602a5-8ccc-4c48-80d8-9a16a0be0f46","year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.839718Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:71095b5788e1558dcff819a33c7282b448ae4ed4e2985dfda2adf0327fe11c92","observation_id":"341f9f31-33d0-4522-9639-33909a0b7b13","resolution":{"observed_at":"2026-08-07T15:23:18.378283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 3 inbound Pith citation observations for arXiv:2505.15380."}