{"as_of":"2026-08-06T13:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8fd41ce555a2bba65d44eb481f93baefa822b8a4832c6ce7e83f50c8923af7a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":61,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:34:08.167239Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:d1db0a0bab5ae920c4c926b493e3fc4ccb379218e38c5c489f8678c0f85eb455","observation_id":"658331e9-759f-4387-83f8-826b084a0d92","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-02T11:31:42.381498Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T04:29:41.285194Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2507.09318"},"observation_digest":"sha256:1a4eae31f01511cfc384ce926579c5ac282fb202f13d51d26a6806242e2007da","observation_id":"89afd59f-6147-4c85-95e2-9fa326083994","resolution":{"observed_at":"2026-05-19T04:32:03.669368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:0828bd12944c53a4a13532dbd06bcb8b1c9a29a0fd1d5b8e22faaeacb67cb9cb","observation_id":"a925d1f3-84b8-455a-9fad-945bdf949598","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T11:34:08.167239Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single- stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-06T11:34:07.488878Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.167239Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:f8736e6df7d78fdb6ed216e19fc3e3f7300fd20de65726cfcfc115fa17dc31e0","observation_id":"0c5d9294-2c5c-4955-820b-fd37b48e7a1b","resolution":{"observed_at":"2026-08-06T11:34:08.167239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T20:04:51.369330Z","title":"Spark-tts: An efficient llm-based text-to- speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-05T20:04:46.917609Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.369330Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:05620f660f42365002294798fcca7c93a9872262834d3307df99053c3c74b4ac","observation_id":"9accb710-3a08-439c-b5ad-e7e7fbbba6c0","resolution":{"observed_at":"2026-08-05T20:04:51.369330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T16:01:52.823558Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T08:55:29.264884Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.823558Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:cb82dcd3844210e695afb8a02c50073a6e28f0a21142223044802ced47896a47","observation_id":"61f5c358-f70e-48f2-9779-a8badee88a3c","resolution":{"observed_at":"2026-08-05T16:01:52.823558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T12:00:45.305208Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.305208Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:1ecdba0576818ef5fafa25381a5a703db7c8f2042ec0ba29a7e764f2fcc4a0bb","observation_id":"c68d5cec-178c-4b7f-87a1-08a6cf00b825","resolution":{"observed_at":"2026-08-05T12:00:45.305208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-04T18:51:21.114170Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.114170Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:8af62c146f9db385392b86a2f44625eb9126a1d600b0e2536fa2aeb507886236","observation_id":"af68322a-adf3-429a-9b59-fdc25d09a134","resolution":{"observed_at":"2026-08-04T18:51:21.114170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-04T19:11:59.596167Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09748","last_updated":"2025-09-11T12:32:08Z","snapshot_observed_at":"2026-08-06T08:55:28.245549Z","submitted_at":"2025-09-11T12:32:08Z","title":"DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T19:11:59.596167Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2509.09748"},"observation_digest":"sha256:5cf7e127361efca89eb5a1230ed2292f0d3b362253484ea01f05f19c400d6a44","observation_id":"4ff6b021-b5f3-451e-894c-08844f99ef49","resolution":{"observed_at":"2026-08-04T19:11:59.596167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-04T11:29:36.515375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.515375Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:33944fe45068cfac5e3d1c3b8ba9a6e0d45387b5e60a0c5a19b8a9d9b4f7697c","observation_id":"06f231c7-7dd5-4e17-92c0-188fee700bf8","resolution":{"observed_at":"2026-08-04T11:29:36.515375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-04T08:29:17.918593Z","title":"Spark-TTS: An efficient llm- based text-to-speech model with single-stream decoupled speech to- kens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.20441","last_updated":"2026-07-02T11:50:55Z","snapshot_observed_at":"2026-08-05T03:41:48.846991Z","submitted_at":"2025-10-23T11:22:24Z","title":"UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:29:17.918593Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2510.20441"},"observation_digest":"sha256:fbbb4b22df2b987b5be9e2d3a623c073f7c78b54df02750fc7d04ef83b83a1ac","observation_id":"2a8b220f-d17b-4d31-b1b5-ea219981fda6","resolution":{"observed_at":"2026-08-04T08:29:17.918593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:acf79e62a1392f56e64061c0073b9e96449727aa8357b3750b3376a9b3734dfa","observation_id":"815c3a28-de4e-4fe9-94b1-972d24b9bfd3","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2603.14267","last_updated":"2026-04-03T07:45:32Z","snapshot_observed_at":"2026-07-06T22:49:06.164294Z","submitted_at":"2026-03-15T07:53:23Z","title":"DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T11:56:13.914121Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2603.14267"},"observation_digest":"sha256:981268ed56b5dbb729734b5c8ea78d45b9991a967c526b9555c4e7efdcca5f7a","observation_id":"d5fc9a45-8b02-43b6-939b-541e33fa06e6","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:fff253900946e08fac22f6ba7d4d63f69abb30b8e0d98d0ab55d02587e89c6d5","observation_id":"0ee2ca03-4cb0-4c66-ba8b-feabbae8ded2","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.08558","last_updated":"2026-06-23T07:14:55Z","snapshot_observed_at":"2026-07-13T23:53:49.367849Z","submitted_at":"2026-03-17T07:35:28Z","title":"WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T10:29:51.313835Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.08558"},"observation_digest":"sha256:f44e344919299ea7f4327945d1d2c72627c6169a714be696587418d0dc41bbda","observation_id":"d3203e74-6950-41b6-b3f9-9b6ad7aae489","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.11103","last_updated":"2026-04-24T05:22:49Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T07:20:20Z","title":"ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T16:03:15.572657Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.11103"},"observation_digest":"sha256:d790f5c218b5b214e01e2cb0eea660fd8bddfc9f0d850cad946158b1cc116021","observation_id":"032baf92-2d34-4419-a84a-9db2a127cc2c","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b280d7af5d54222479a2269aace187d02c1cf381f5a96e43643911c0883b43f5","observation_id":"9e41184c-0120-46dc-823d-c196fdc6e7cb","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:6d9227f51357dabb4e64b50a5438f7ee4a2c952fd597a49cdd2172a1d857485d","observation_id":"5bb3292c-5288-40fd-be9f-aa3f4257990a","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.16211","last_updated":"2026-04-21T13:32:36Z","snapshot_observed_at":"2026-08-01T22:51:55.583851Z","submitted_at":"2026-04-17T16:20:55Z","title":"NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T07:37:44.393592Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.16211"},"observation_digest":"sha256:c0ee0347ff87080b6fddcf1d8b8e09495f6c8c1bcd032d40b8c4636c84636309","observation_id":"7759d619-2cfb-40c0-9a1f-c3b129291c2a","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.17958","last_updated":"2026-04-20T08:39:55Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:39:55Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T04:03:38.919545Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.17958"},"observation_digest":"sha256:c33cef095a7652316b2a2a03a29003bf0d20447fcfb7c43d752851872dba5aca","observation_id":"e1e6834f-1a4a-4a34-9992-c3c0b4df4f7c","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.23742","last_updated":"2026-04-26T14:42:50Z","snapshot_observed_at":"2026-07-06T23:09:52.860780Z","submitted_at":"2026-04-26T14:42:50Z","title":"RTCFake: Speech Deepfake Detection in Real-Time Communication","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T05:29:45.895667Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.23742"},"observation_digest":"sha256:5025ea908e1c2fa3c510d8b1a00cf9c54bc391fbdb6c14a17cf877e4b1913268","observation_id":"cc57d162-1654-46ea-aa7e-a8702aab346b","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:2a23e35e50c8ad8ba43089f4bc24751cfc226d4569cd47c5b65bdd8b9e65d59d","observation_id":"6c12d119-f452-48b7-828a-6f0fc7a4ea25","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-02T15:21:28.920158Z","title":"Spark-tts: An efficient llm- based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.920158Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:9c72ce964611588660ef59f75e6be8fb250c71024ca8706fa189e5853ab0bf74","observation_id":"efb8d1e8-9160-4f13-8a1a-d8e873d46580","resolution":{"observed_at":"2026-08-02T15:21:28.920158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:3c6bce9c62563588d6641343d47a1369d04b47883b7304f94ffadbaa1c287fd1","observation_id":"81a62402-3d51-45c6-98cf-bb2906a96b7f","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.08608","last_updated":"2026-05-09T02:07:57Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T02:07:57Z","title":"Reducing Linguistic Hallucination in LM-Based Speech Enhancement via Noise-Invariant Acoustic-Semantic Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.733585Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.08608"},"observation_digest":"sha256:ac5199678c60883892531701a4f9bb1d0418492c2d3ff93677b769ed0a99c2d5","observation_id":"6977a6bd-2144-48d5-99e7-34103be00a11","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.09386","last_updated":"2026-05-10T07:24:55Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:24:55Z","title":"Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:04:44.050889Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.09386"},"observation_digest":"sha256:8dd7225b717e61a444de49bb865802e56e01ac5910ac74cfc4a4215a4c339e0b","observation_id":"e007d887-c74f-4f1b-919e-9e9e6e87eee2","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.10199","last_updated":"2026-05-11T08:46:47Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:46:47Z","title":"How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T03:08:55.753359Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.10199"},"observation_digest":"sha256:18f1c3c562f66326da449e01ab615fa30b19fb0370f3ceb1b59e4456a6aa2467","observation_id":"0b14dfbb-e19b-4af2-a375-5ab8589f6bc3","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.11098","last_updated":"2026-05-11T18:04:33Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:04:33Z","title":"AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-13T01:04:54.506749Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.11098"},"observation_digest":"sha256:29cab53d91683951945d2a690c54797f5e856c57835948f48c5daf5fd61cc4d0","observation_id":"6ae81e12-bb5b-46de-aff7-f569e95e1a1b","resolution":{"observed_at":"2026-05-17T09:39:51.552824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.16964","last_updated":"2026-05-16T12:37:06Z","snapshot_observed_at":"2026-08-02T05:10:05.598125Z","submitted_at":"2026-05-16T12:37:06Z","title":"SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T18:58:15.288299Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.16964"},"observation_digest":"sha256:adc874500231a36d90d59e6274236e030a9fa3e7d7c1a0fdb3532a51fdf3774d","observation_id":"9607944b-5c3b-41ae-b04c-c10646d4901c","resolution":{"observed_at":"2026-05-19T19:02:43.603286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-08-02T22:28:42.271827Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:16964bae7a51021fdf1f4cdcbae579a66ce05f99cbf62dc58f1f26753d650ea3","observation_id":"a98bcf48-2a04-4ac6-8f94-fb52873bf9d3","resolution":{"observed_at":"2026-05-20T21:19:03.226500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T02:56:06.910758Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:8e66799b1267b7e7a8a9bb447404bf0e04005c676deb2110dbafe250f165159d","observation_id":"29e3e707-dd00-4e28-b5dd-054cff31428d","resolution":{"observed_at":"2026-05-22T03:00:59.013899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-02T13:29:53.566575Z","title":"Spark-tts: An efficient llm- based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T13:29:53.566575Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:40c80b54f4ba1dcd450272e8ddc65d8be8cfc7354a75e499d1f37ba5326e4ab4","observation_id":"1ccef922-c3a6-4f84-9aa0-7095ea3f6202","resolution":{"observed_at":"2026-08-02T13:29:53.566575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.25967","last_updated":"2026-05-25T15:43:20Z","snapshot_observed_at":"2026-08-04T17:39:39.402173Z","submitted_at":"2026-05-25T15:43:20Z","title":"Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T23:08:06.858906Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.25967"},"observation_digest":"sha256:6ba8148c21668434e214df44aa5ff90a1378c9f47eaaf8100e72c708d9cda668","observation_id":"85d2052b-70ad-48c4-94d6-25e41c559dfa","resolution":{"observed_at":"2026-06-29T23:14:01.868617Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:df1df2df4f9e3a825f5373ff9c2a68ce745d149a9e64a80fe1f26d71264cc5dd","observation_id":"b7f74d6d-11cc-4c4a-a803-fb5f05c44891","resolution":{"observed_at":"2026-07-01T20:26:13.152245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:2afba8a3cbd0aea7c228f139f145f562bc464de02a72d39faa9ad7cb66b4e57b","observation_id":"8665f702-ea46-4599-849c-b89776716389","resolution":{"observed_at":"2026-07-02T05:16:39.744079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:b3d6fc81ea331fa028414f836b19c134ae52401181294d49cf0263c7f94cc500","observation_id":"3174fc14-969f-4e16-b1f8-dda8ee890e65","resolution":{"observed_at":"2026-06-28T05:21:39.804685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.05889","last_updated":"2026-06-04T08:58:57Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T08:58:57Z","title":"GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T23:53:55.385445Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.05889"},"observation_digest":"sha256:6cceaed376a0ed4890993888eea3e2712d977000e699d9bc8e6fd3666aee0a37","observation_id":"1a1f96d6-7f35-4392-9505-788a2d154bae","resolution":{"observed_at":"2026-07-02T15:27:04.877027Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:2570567d884128846eab6e05fa1400b3d6681673016d064c7138b88882f40dca","observation_id":"e8aeb4cb-e157-4f1e-952e-49575cdc4a3d","resolution":{"observed_at":"2026-07-03T03:07:35.861159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-03T07:58:02.783857Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:890a0a1cee09b49968b0c61b6f191bb82478092c4eca471838aae49061bf4d64","observation_id":"4c5aa081-7ff1-4e12-b4b4-28eb23a8961a","resolution":{"observed_at":"2026-07-03T03:27:36.146102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.09234","last_updated":"2026-06-08T09:07:23Z","snapshot_observed_at":"2026-08-05T17:27:24.038541Z","submitted_at":"2026-06-08T09:07:23Z","title":"End-to-End Training for Discrete Token LLM based TTS System","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:06.893507Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.09234"},"observation_digest":"sha256:c478b07443e1f96c260d4d310ae51784f5b71fd54920d58fde6f494b8f2b03d3","observation_id":"0491a8e6-a336-4ea9-82c2-9999197fb4a0","resolution":{"observed_at":"2026-07-03T03:27:34.903098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.21157","last_updated":"2026-06-19T06:49:06Z","snapshot_observed_at":"2026-08-03T05:26:44.843227Z","submitted_at":"2026-06-19T06:49:06Z","title":"SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T13:19:43.545346Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.21157"},"observation_digest":"sha256:9c2d5a53bafd894ebdda0a8597e87208ecf0d8d4ec9e3c9782b486a98f46a09d","observation_id":"aa152316-2677-43d6-9aa4-a45bfef35ba0","resolution":{"observed_at":"2026-07-04T07:39:38.407351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.21365","last_updated":"2026-06-19T12:14:17Z","snapshot_observed_at":"2026-08-03T12:18:50.788553Z","submitted_at":"2026-06-19T12:14:17Z","title":"LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T12:58:27.702138Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.21365"},"observation_digest":"sha256:be1a8a2abede7a56faed3858edd96ff86b1bcc68ae321d7d5358eecba61c84a9","observation_id":"587579d2-b9a5-4802-a375-8e9153cda095","resolution":{"observed_at":"2026-07-04T07:39:39.524651Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.21882","last_updated":"2026-06-20T04:47:45Z","snapshot_observed_at":"2026-07-30T10:32:12.615292Z","submitted_at":"2026-06-20T04:47:45Z","title":"Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T11:42:44.035902Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.21882"},"observation_digest":"sha256:69bdd7ac067b1ed7ba7cd3019e876c271096515c309802446cedf374dd40825b","observation_id":"86040e40-24ad-4087-9471-978b9f711cf6","resolution":{"observed_at":"2026-07-04T08:29:41.337402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.21893","last_updated":"2026-06-20T05:58:50Z","snapshot_observed_at":"2026-08-06T08:56:11.950592Z","submitted_at":"2026-06-20T05:58:50Z","title":"AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T11:37:39.960212Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.21893"},"observation_digest":"sha256:2ab96b307caa0cfea9de75f88138324929fd2f47ca84af011139ee89121b8bd5","observation_id":"f2ca7e14-86e9-45ab-9112-d512c0572d1c","resolution":{"observed_at":"2026-07-04T08:29:41.882848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.21933","last_updated":"2026-06-20T08:00:12Z","snapshot_observed_at":"2026-08-02T09:30:55.390588Z","submitted_at":"2026-06-20T08:00:12Z","title":"ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T11:33:32.067771Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.21933"},"observation_digest":"sha256:24f1adfb61b138bfa8ae0e0c082e4be8f1bf494693b6ba41b9f53661b232acd6","observation_id":"b6ca7271-a549-4947-87c6-96b4d5e84e2f","resolution":{"observed_at":"2026-07-04T08:29:42.158604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T07:02:36.499424Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:c8800acfb9e39e5bbd8cbfaaffe55d893bd098b0e23e6205fdb90a8b0e8745b4","observation_id":"d3c53df9-fa03-4088-a98d-fc2409abcfd6","resolution":{"observed_at":"2026-07-04T12:19:49.663900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-12T12:44:20.831164Z","title":"Spark-tts: An efficient llm- based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T12:44:20.831164Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:4dc7dd29bf14b6ef16e4e7102c4c2c994a714f93fd52f752ecf9b83086d48cc3","observation_id":"863ace9b-822c-4cb7-b5f6-4a8a1a89481e","resolution":{"observed_at":"2026-07-12T12:44:20.831164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.25403","last_updated":"2026-06-24T05:02:36Z","snapshot_observed_at":"2026-08-01T01:01:18.146622Z","submitted_at":"2026-06-24T05:02:36Z","title":"CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T20:21:47.681999Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.25403"},"observation_digest":"sha256:d34bfaebd30b2c630254e11e60e789d587fbf15aaa64bde1d3561612f78bb962","observation_id":"dc2309cc-a33c-4d8a-854a-4a958ba64342","resolution":{"observed_at":"2026-07-04T20:20:07.170409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":209,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:1715cbd2f609582d34024d0e680e4c9d8b4e22e7dfd3301f0a8cd2e0a437e37b","observation_id":"526c3869-1c27-4d3b-a04b-08bda1d6c4c1","resolution":{"observed_at":"2026-07-01T11:45:47.168565Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-11T21:24:36.925360Z","title":"Spark- tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens.arXiv preprint arXiv:2503.01710, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04140","last_updated":"2026-07-05T06:45:47Z","snapshot_observed_at":"2026-08-06T05:51:10.452020Z","submitted_at":"2026-07-05T06:45:47Z","title":"DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T21:24:36.925360Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.04140"},"observation_digest":"sha256:6bcd0b85ac222ceaa1691a30f8d4c619f5020fb9b9981132c75800fe329aa105","observation_id":"bd6ce112-e622-4ab7-8cbf-dba419703643","resolution":{"observed_at":"2026-07-11T21:24:36.925360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":243,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:aa2ebec9b51ff4c52abd92630b223fc02ed5d8ec6682c58230d4e4c34c3fd965","observation_id":"d9825cfb-f65c-4be8-9c6a-9eae8e64d9fa","resolution":{"observed_at":"2026-07-08T00:04:22.654037Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2503.01710 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":243,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:aca0c2a2f7919ee513338958c706d489da90776c35c9b3317c50610596f8a0c2","observation_id":"308b3215-00ce-4f70-b0cf-f6b0318882bd","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-13T05:10:26.667731Z","title":"arXiv preprint arXiv:2503.01710 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09134","last_updated":"2026-07-10T06:44:04Z","snapshot_observed_at":"2026-07-15T23:18:04.278291Z","submitted_at":"2026-07-10T06:44:04Z","title":"ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-07-13T05:10:26.667731Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.09134"},"observation_digest":"sha256:87a298baf382fc2a8b7eeafc4a8584576ef38206155c003806908d5ff7519a0f","observation_id":"a83b9699-f724-4176-8de1-21615976fa81","resolution":{"observed_at":"2026-07-13T05:10:26.667731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-13T02:22:47.820537Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens.arXiv preprint arXiv:2503.01710,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09530","last_updated":"2026-07-22T14:29:04Z","snapshot_observed_at":"2026-08-06T08:33:56.882642Z","submitted_at":"2026-07-10T15:36:30Z","title":"FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T02:22:47.820537Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.09530"},"observation_digest":"sha256:602cb83368b4df3e71baa19e80ecd07091e992fdd0c1de893ed76dad117d7038","observation_id":"7ed4bf9d-46f4-47da-b1d1-88d7a861b82c","resolution":{"observed_at":"2026-07-13T02:22:47.820537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-02T07:39:23.645758Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens.arXiv preprint arXiv:2503.01710,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09530","last_updated":"2026-07-22T14:29:04Z","snapshot_observed_at":"2026-08-06T08:33:56.882642Z","submitted_at":"2026-07-10T15:36:30Z","title":"FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T07:39:23.645758Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.09530"},"observation_digest":"sha256:0831cb7301f3b6bd4eb8613abc66103a252cb3d61484e1c7809ababcdd58730a","observation_id":"efa9c8c8-f4b2-4418-9237-48cb0f51b532","resolution":{"observed_at":"2026-08-02T07:39:23.645758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-01T08:40:27.564412Z","title":"Spark-TTS: An efficient LLM-based text- to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-02T03:02:00.143086Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.564412Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:2d591641efc780ff7df02bdddacd5b46f3a6154c1f2f356b136f18fadf3656b2","observation_id":"69ce9690-b3f7-48be-9344-2ff340b19901","resolution":{"observed_at":"2026-08-01T08:40:27.564412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-31T23:35:21.089160Z","title":"Spark-tts: An efficient llm-based text-to- speech model with single-stream decoupled speech tokens.arXiv preprint arXiv:2503.01710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23938","last_updated":"2026-07-27T02:30:15Z","snapshot_observed_at":"2026-08-06T09:15:17.907620Z","submitted_at":"2026-07-27T02:30:15Z","title":"Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:35:21.089160Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.23938"},"observation_digest":"sha256:7cd6541dd8a90463a2ca117fbc228bdb717d969aba5080962c3643e48f9680c4","observation_id":"20c6fb94-ab8a-4374-abb5-e373528bc0a0","resolution":{"observed_at":"2026-07-31T23:35:21.089160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-30T11:37:00.186862Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27109","last_updated":"2026-07-30T02:37:20Z","snapshot_observed_at":"2026-08-06T10:29:34.142993Z","submitted_at":"2026-07-29T16:38:08Z","title":"MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T11:37:00.186862Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.27109"},"observation_digest":"sha256:0aaa4c7e0e9102567732ad222768956559cb51849dd118b60bced53d5cb28a7a","observation_id":"65821001-88bc-4a4f-8301-65f88dc8ba45","resolution":{"observed_at":"2026-07-30T11:37:00.186862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-01T09:59:39.136823Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27109","last_updated":"2026-07-30T02:37:20Z","snapshot_observed_at":"2026-08-06T10:29:34.142993Z","submitted_at":"2026-07-29T16:38:08Z","title":"MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T09:59:39.136823Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.27109"},"observation_digest":"sha256:913de9fde9fa13fc1172ddb14a5e674c9d1caefbaa2c64f9ba70da4d9aed268b","observation_id":"3c693153-dad8-4601-af31-ad398c47d5ec","resolution":{"observed_at":"2026-08-01T09:59:39.136823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-03T08:35:55.557807Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:55.557807Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:3ed8119fbccdf500691ebc117d13bf6fda68743b58924a2fc0f3b539dfac55c9","observation_id":"4ca58211-2071-4b36-82ff-2a6c4b26cb4b","resolution":{"observed_at":"2026-08-03T08:35:55.557807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-04T16:29:29.149236Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-06T13:32:48.955432Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:29.149236Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:1b0a37eec9a01e823539c9051eb82a5e8817500f6b892740fc6273a590a51061","observation_id":"8f826f4d-6309-454f-a685-1ce916139be0","resolution":{"observed_at":"2026-08-04T16:29:29.149236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.01710/citation-record","integrity":"/paper/2503.01710/integrity","json":"/paper/2503.01710/citation-record.json","paper":"/paper/2503.01710"},"outbound":[],"paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 61 inbound Pith citation observations for arXiv:2503.01710."}