{"as_of":"2026-08-19T22:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:674c5529c23f4c0dd968f4e44dcaa3401a6509b066a0cc1b087b6865d7e2e4e2","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T05:09:34.802612Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T05:09:34.802612Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T05:14:35.199833Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"cited_work":{"arxiv_id":"2607.06461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.06461","snapshot_observed_at":"2026-07-08T05:14:35.199833Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","venue":"eess.AS","work_id":"51d0fecc-769f-4156-bcd2-6f584082c329","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2607.06461","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:0d8f5840ad89ade1681e161536eb3efcf880466a9efc3a452763257f5778feb0","observation_id":"438cc1ce-dfd5-4814-80e4-8e8e06519130","resolution":{"observed_at":"2026-07-08T05:14:35.202276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.06461/citation-record","integrity":"/paper/2607.06461/integrity","json":"/paper/2607.06461/citation-record.json","paper":"/paper/2607.06461"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"cited_work":{"arxiv_id":"2607.06461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.06461","snapshot_observed_at":"2026-07-08T05:14:35.199833Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","venue":"eess.AS","work_id":"51d0fecc-769f-4156-bcd2-6f584082c329","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2607.06461","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:0d8f5840ad89ade1681e161536eb3efcf880466a9efc3a452763257f5778feb0","observation_id":"438cc1ce-dfd5-4814-80e4-8e8e06519130","resolution":{"observed_at":"2026-07-08T05:14:35.202276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.346474Z","title":"Overview of WordV oice-5A Several large-scale open-source speech corpora have sig- nificantly advanced the development of zero-shot TTS [14, 15, 16]","venue":null,"work_id":"f010e4f1-90c6-45ab-a4e7-dd6114efd6cb","year":null},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:fd8e56ca7b0ef6db9f49f655f25880f0af11a8b2d60ed185861bcd6a2972c5d2","observation_id":"7dc65520-1057-424d-a7cd-7b2c80570886","resolution":{"observed_at":"2026-07-08T05:14:35.349750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.386667Z","title":"acoustic planning","venue":null,"work_id":"14c54dda-d418-4302-aa49-6d0b6fc29371","year":null},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:6d7aacc52ecd732e98df3439e36a527730f481d701c1e6ae6bb4bf342f679af5","observation_id":"06bbb9cb-f615-4687-9d80-4c79812d3ac6","resolution":{"observed_at":"2026-07-08T05:14:35.388376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3680.0947","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.203799Z","title":"Experimental Setup We evaluate our method on the WordV oice-5A-test set, com- prising about 2,000 Chinese and 1,500 English unseen ut- terances","venue":null,"work_id":"ecdadd87-1fd7-4c08-ba58-4d10f1ab4cfe","year":2030},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:366535809f328b715782c33661db1f87dba62aaf79eb666cb97e948e3b7affd2","observation_id":"476a24fd-c548-412d-8574-f17a63d7eee3","resolution":{"observed_at":"2026-07-08T05:14:35.206410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.389445Z","title":null,"venue":null,"work_id":"40c4b5ce-4051-4ed6-baa9-fa4a66be8340","year":null},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:9ec5f08e2a242665fcc1286f5be568d98f54dc2caf98215708c69bb1d3d54f74","observation_id":"03077e0d-be3b-4d6f-b204-ba09b7d90dfa","resolution":{"observed_at":"2026-07-08T05:14:35.390922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.397994Z","title":"Emosphere++: Emotion-controllable zero- shot text-to-speech via emotion-adaptive spherical vector","venue":null,"work_id":"669b67b8-758f-4ee2-9fe0-af87a64022e5","year":2025},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:595168b42e853db1cc1abda590cdad8607409b8c5cbcbcb0c02c3a41cea10670","observation_id":"769518fd-403c-4d48-bf25-e5da6fb2c017","resolution":{"observed_at":"2026-07-08T05:14:35.399994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.371911Z","title":"Facespeak: Expressive and high-quality speech synthesis from human portraits of different styles,","venue":null,"work_id":"0e503ef2-9001-4b28-b9f2-8f2edb1c729a","year":2025},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:85ba5eadc6ad688bdadff9ab28315201e6404c9ac17b58c8b95917b1183bed78","observation_id":"4c152270-885d-4e43-aa32-a5b657ed1a1f","resolution":{"observed_at":"2026-07-08T05:14:35.374463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.400670Z","title":"Scalable controllable accented tts,","venue":null,"work_id":"1e372789-3714-4454-80a2-bf0ddcfffd82","year":2025},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:060f5251c8c0e9641d1bd8aa75c0652e5cd48d2d26214fcc753cc14507527a72","observation_id":"66bab643-0bc0-4923-a566-3ccfb6e1bb0f","resolution":{"observed_at":"2026-07-08T05:14:35.402098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.405529Z","title":"Instructtts: Modelling expressive tts in discrete latent space with natural language style prompt","venue":null,"work_id":"fddd95d2-189b-4dc4-952f-ea7379e1dc5e","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:adebe389f4628a3f25b6fc17049f23e19d5e01fcfb12c6f1b7c9d36dcb330447","observation_id":"004cbd2b-4601-4f9f-ba22-f6f69da22755","resolution":{"observed_at":"2026-07-08T05:14:35.407108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:858454c79f660edb2b4f7961b921008ff8000515681a7939346a7f5a4733e287","observation_id":"29ed34aa-4b29-4974-aad7-8f76ccfb7fd0","resolution":{"observed_at":"2026-07-08T05:14:35.210903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:13.622895+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:13.622895+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.317985Z","title":"Hd-ppt: Hierarchical decoding of content- and prompt-preference tokens for instruction-based tts,","venue":null,"work_id":"3d06250a-6f71-4877-90cc-0cadc0cd75cc","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:03d3da6d16705b70934fd0cca3fb3a90f9d02a6c3a75bd1bae75517fcee3487f","observation_id":"cd47ba6f-5544-49b5-a464-0f16e366703c","resolution":{"observed_at":"2026-07-08T05:14:35.319449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.391808Z","title":"Deep dubbing: End-to-end auto-audiobook system with text-to-timbre and context-aware instruct-tts,","venue":null,"work_id":"6d9036ff-e0db-42e5-b750-2a66dac57e7f","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:31961a8f0e3f03a2b364a5bdef6348a04185704685c268cd7a7584160e6a718a","observation_id":"0e863b7f-d250-427d-98fe-16abf7a70370","resolution":{"observed_at":"2026-07-08T05:14:35.393361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21164","last_updated":"2026-04-27T17:57:41Z","snapshot_observed_at":"2026-08-15T16:08:34.573409Z","submitted_at":"2026-04-23T00:13:16Z","title":"MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control","version":2},"cited_work":{"arxiv_id":"2604.21164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.21164","snapshot_observed_at":"2026-07-08T05:14:35.184289Z","title":"MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control","venue":"cs.SD","work_id":"b1e631c7-b602-4df0-8c51-fb603c32f4a7","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2604.21164","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:f494b14849e81925919428dfa23ed1c6a8d3b62daab3f350a840ecf66948309e","observation_id":"ec4d5115-d1a6-46da-b9a2-142a33034c98","resolution":{"observed_at":"2026-07-08T05:14:35.191069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.322005Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis,","venue":null,"work_id":"9a6d432d-750f-4868-9ce3-43f6c7feba94","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:b8965ce04347fedca68cefc496a70cf19540becb7c8d837ca9c0fb1a97a00c2d","observation_id":"f8cae5a2-c6b9-4ace-a002-959bb432b877","resolution":{"observed_at":"2026-07-08T05:14:35.323938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.364150Z","title":"Di- flowdubber: Discrete flow matching for automated video dub- bing via cross-modal alignment and synchronization,","venue":null,"work_id":"01babb31-7e30-4d89-9715-62e9bc5649dc","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:9e278f1d23c38aeb7d59f10934e572288525581017b94a9af872142a069f00e9","observation_id":"dff54b9b-a21b-42df-813f-a4d38ceddc4e","resolution":{"observed_at":"2026-07-08T05:14:35.367832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.358818Z","title":"Fastspeech 2: Fast and high-quality end-to- end text to speech,","venue":null,"work_id":"6c84121b-47b3-4f87-8972-9a51f63721c8","year":2021},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:58d4f21b8daab45a41cb1f624d6d0c5ecab5aad12a05b0aa938c594b69670d8b","observation_id":"9accc0e3-a898-48a0-a184-2f16a4c51616","resolution":{"observed_at":"2026-07-08T05:14:35.360398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.407732Z","title":"Conditional vari- ational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"3704232d-4e25-4ee7-b4bd-edc33f45fe09","year":2021},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:37c78b3794678bfc81322784a2b387715fce0d9e6a3c56565e9bf154cdbc117b","observation_id":"9a66b4dc-b8d7-4e25-83e5-c6027834b985","resolution":{"observed_at":"2026-07-08T05:14:35.409227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.379172Z","title":"Word-level emotional expres- sion control in zero-shot text-to-speech synthesis,","venue":null,"work_id":"bcf0ca60-74d8-4002-9d69-029472e7be19","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:b2b10796b28f89085ec062c9f0463d53edbb11c2f657164ee573a6c2799df3cc","observation_id":"8fef926d-300f-4bee-a1b1-8dbea2b008ad","resolution":{"observed_at":"2026-07-08T05:14:35.381462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.361340Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":"e37fa0c8-fc2e-43e3-8a80-8ee9bafa76f1","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:35fd80a6f61c898d91f40a3ac4b0456a5e7acc6ad8f8bf22e3ec62cfd71d561f","observation_id":"752bb62c-b468-419e-9aa4-61162a55f10a","resolution":{"observed_at":"2026-07-08T05:14:35.362887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.354939Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models,","venue":null,"work_id":"e36ae0c5-7194-4514-b687-2918cf9f3c48","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:8456e70c5599be94bf00b5a8acc3ba0065c4687f1f2ea0767c6f6e3c3487def2","observation_id":"fca09a3e-aa5b-4d74-9153-c1f27c158fa4","resolution":{"observed_at":"2026-07-08T05:14:35.357410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.394215Z","title":"Speechcraft: A fine-grained expressive speech dataset with natural language description,","venue":null,"work_id":"7576525b-674c-4e5d-80ec-bc64f8fd4d10","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:d248dc680d5419aa74bd94685812e88902bfcbd106bc8ce317da0e79127eac68","observation_id":"18dedd07-d8ac-4b5a-b7b2-39a955fd8f4a","resolution":{"observed_at":"2026-07-08T05:14:35.397281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.216760Z","title":"Lemas: Large a 150k-hour large-scale extensible multilingual audio suite with generative speech models","venue":null,"work_id":"e0ca2ed9-e78c-4471-9208-928c2967d491","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:dd4bc1dd228c1953594837491ef5e9649df773299bfd5fca828c804ecaaa6bac","observation_id":"9fef3e93-8eb1-45b2-a641-054cdee4c79c","resolution":{"observed_at":"2026-07-08T05:14:35.219334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.402703Z","title":"Praat script to detect syl- lable nuclei and measure speech rate automatically,","venue":null,"work_id":"55034575-94b1-4da7-a0aa-53d100157058","year":2009},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:a9d3ca7e0be8ba81f97ecacfee6f5b5cd392aa933adb09124f614332979db472","observation_id":"20481646-4367-4088-9f35-361e70645fbf","resolution":{"observed_at":"2026-07-08T05:14:35.404855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.375860Z","title":"Tobi: A standard for labeling english prosody,","venue":null,"work_id":"8269a719-3bfc-4c62-871f-613e3c77245c","year":1992},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:5c91eb590ceb526eb7a053d4f76edee7348427149f600f49262cc0e4c3fb7b7f","observation_id":"082c4c6b-aa74-41fa-bfed-3b5c34fd1c6c","resolution":{"observed_at":"2026-07-08T05:14:35.377885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.382296Z","title":"Chinese prosody and prosodic labeling of sponta- neous speech,","venue":null,"work_id":"3c1ee984-6cae-4143-b16a-66602a8f8826","year":2002},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:cb9427a76f688b8248a9dd0b2886d494b368255bc0f043ca56039e5d83baab64","observation_id":"a9ddb654-9a17-4432-987c-914523c64529","resolution":{"observed_at":"2026-07-08T05:14:35.384540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.324611Z","title":"Smoothing and dif- ferentiation of data by simplified least squares procedures,","venue":null,"work_id":"c643eed7-2125-4679-a4ed-ee7989e0bd3c","year":1964},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:cda4e51226a2d481c393fe303eaccd17b3d1289d2d080645ce11bb11343de630","observation_id":"c30748ee-b961-4b03-aecf-ea23cfbb2afd","resolution":{"observed_at":"2026-07-08T05:14:35.333590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.320104Z","title":"Monotone piece- wise cubic interpolation,","venue":null,"work_id":"0a3d1454-c6ee-4a9e-82ee-0d59308019a2","year":1980},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:8a3bc7678c910820fa104dd804717302c520ccfd60315e60c10c6dc43743539d","observation_id":"0f59c3ce-b124-4939-8acf-a20b47bd4b4c","resolution":{"observed_at":"2026-07-08T05:14:35.321431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.312747Z","title":"Sound level protrusions as physical correlates of sonority,","venue":null,"work_id":"33fbb40e-c7d8-4c64-be42-f6b1175a753b","year":2008},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:c6b41cf9b0c6a95a1329f3e0d530d411abd62d7ba6065416926112cac966ce91","observation_id":"d74c1440-bcef-4cf5-b90a-81004b73dcb5","resolution":{"observed_at":"2026-07-08T05:14:35.314036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.350987Z","title":"Considerations in the normalisation of the funda- mental frequency of linguistic tone,","venue":null,"work_id":"e5b243cd-2354-468e-b596-e62213e74810","year":1987},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:f0ef8addea0ad88832c9dd0d26ff60bc402402346cb071d41d0b89a9d7e4236b","observation_id":"a57a7a16-7d25-4940-b772-c5dd242203e8","resolution":{"observed_at":"2026-07-08T05:14:35.353346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.301837Z","title":"Acoustic features of mandarin tone production in noise: A comparison between chinese native speakers and korean l2 learners,","venue":null,"work_id":"752362ca-d933-4adb-b9a0-61710fa6c6b9","year":2025},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:ecedbc374494e1b23faa82eea3a9402e073784e9bb406ef58e06d8c8b794a682","observation_id":"95f7fee4-bf8d-4dbe-bc47-116a2ed00f32","resolution":{"observed_at":"2026-07-08T05:14:35.304670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.305555Z","title":"Modeling tone and intonation in mandarin and english as a process of target approximation,","venue":null,"work_id":"bdfa0116-0916-4b39-b2cc-526bd62a7524","year":2009},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:d00b257c1542f23f38dbfe118cae4fccb91a70d878d80df33cac64a100f11be8","observation_id":"19dd8176-4bdd-48c7-900b-b99f09205ebb","resolution":{"observed_at":"2026-07-08T05:14:35.307634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.335795Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":"3a4df0c0-ee35-44c8-ae99-706027228293","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:10f6427d448482cbf5efdde2e3b7fd6d2c673a117623f1760ab10485eae1ef8c","observation_id":"5e1ce995-76c2-4fde-bd10-0fa8cd2fea09","resolution":{"observed_at":"2026-07-08T05:14:35.339602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":"2601.15621","doi":"10.48550/arxiv.2601.15621","metadata_source":"pith","pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-TTS Technical Report","venue":"cs.SD","work_id":"6e1ae3e6-2062-4e44-a140-5c75409032cd","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:590fc2d489b599c01bc651009d5f633200b554bba952fbca50fae777552f60cf","observation_id":"63524f2f-3004-4f3a-a6ef-20f58fbb9592","resolution":{"observed_at":"2026-07-08T05:14:35.232183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:12.278123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:12.278123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.18090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.179685Z","title":"Moss-tts technical report,","venue":null,"work_id":"32ad8378-2657-4fdf-a44f-9bd70e0c2db6","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:b4107ce2ed595ea762574e5d17a6205ceb80b0be62a41c085e0f79dfdc0edf52","observation_id":"c1c910a5-cc10-4099-8073-99b634d5898f","resolution":{"observed_at":"2026-07-08T05:14:35.182112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:14f8ae2cdfc98dacfb6142f5296798285df208c2169061abbf3947946179594f","observation_id":"e9165386-2451-42cd-beea-377813d722bf","resolution":{"observed_at":"2026-07-08T05:14:35.215391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:11.49925+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:11.49925+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28249","last_updated":"2026-06-26T16:35:48Z","snapshot_observed_at":"2026-08-13T00:47:00.894779Z","submitted_at":"2026-06-26T16:35:48Z","title":"HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2606.28249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.28249","snapshot_observed_at":"2026-07-08T05:14:35.221761Z","title":"HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech","venue":"eess.AS","work_id":"360bb6a4-00ab-4257-a2a8-af5a388ddf38","year":2026},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2606.28249","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:d38ea13f4b5d44b6f91cee1e52a015fe63dc0df04ede87429ea131b08d19c01a","observation_id":"35794823-e47a-4139-b707-d5cc2a093b73","resolution":{"observed_at":"2026-07-08T05:14:35.225166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:43a9cbee443a53eda7c4a43acee06bf372ddbe41724e33297241adb3fd491a2d","observation_id":"81016160-7cdc-48f7-bdc2-45f5dd2dcf22","resolution":{"observed_at":"2026-07-08T05:14:35.196999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.340840Z","title":"Text- free prosody-aware generative spoken language modeling,","venue":null,"work_id":"7279c917-eff0-43cd-b87b-684158a51c19","year":2022},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:84452cea72166f064a358a7814c058b748c436346192143c2d528575b16f76cc","observation_id":"49189f95-6c17-4aec-81c5-26eff76132e3","resolution":{"observed_at":"2026-07-08T05:14:35.344091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.309822Z","title":"Multi-task learning using uncertainty to weigh losses for scene geome- try and semantics,","venue":null,"work_id":"8954a168-a4de-4567-94f1-471d712e4d19","year":2018},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:096492b2cec8f48f29b770047a16b3e18df96caba1d15b1ae6f388be79935cf0","observation_id":"abc989ab-da08-4463-8fc5-671b501b63c4","resolution":{"observed_at":"2026-07-08T05:14:35.312064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.315131Z","title":"Scaling speech tech- nology to 1,000+ languages,","venue":null,"work_id":"5acb4fde-0567-4306-860f-7fbcce320ea5","year":2024},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:207cbcf3e31e3ee1d20974682469dde43da54855f90801d6e2475540a3e953dd","observation_id":"b58c0be2-c677-438b-875e-d2f78ce0c924","resolution":{"observed_at":"2026-07-08T05:14:35.316616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.368957Z","title":"An overview of voice conversion and its challenges: From statistical modeling to deep learning,","venue":null,"work_id":"7cebabf5-7a75-4155-b006-6a504e98e31d","year":2020},"citing_paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T05:09:34.802612Z"},"links":{"citing_paper":"/paper/2607.06461"},"observation_digest":"sha256:e9b19644310f85cf924130abf94ebd9bf079bb91c9ff56d000d2f8b233ea493e","observation_id":"76ec2a85-0826-437e-94af-5c8f54ef1d31","resolution":{"observed_at":"2026-07-08T05:14:35.370869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06461","last_updated":"2026-07-07T16:22:59Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T12:55:33.343718Z","submitted_at":"2026-07-07T16:22:59Z","title":"WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":10,"verified_fuzzy":30},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2607.06461."}