{"as_of":"2026-08-06T03:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cac737455dc4fca5b3c7a524aa3401f77e116e9d2359aa2d2f7163525575a5eb","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T15:51:21.519785Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.27258/citation-record","integrity":"/paper/2605.27258/integrity","json":"/paper/2605.27258/citation-record.json","paper":"/paper/2605.27258"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Neural codec language models are zero-shot text to speech synthesizers.IEEE T ransactions on Audio, Speech and Language Processing, 33:705–718, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:2f4c88c596eacd817b5908458e992b93cf29fcb92a5ade2e7ec299950e84b39a","observation_id":"fc7704f2-7f34-4285-b233-67ebe54a3184","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Naturalspeech 2: Latentdiffusionmodelsarenaturalandzero-shotspeechandsingingsynthesizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:8d27a4b746269ef11701dd2bd78e63256e708c124566158beae98cb8bb980e8f","observation_id":"ebb4f618-57f3-4f8f-a8c1-bd1cd9384d8b","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:82f34c4daf4188f6327c7a620e73988f183ccf71310963eb2e638c2d61228c25","observation_id":"a795d270-d0da-4fde-a878-3e70b2b63207","resolution":{"observed_at":"2026-06-29T16:23:39.877202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:5f43a5108ff0be14f64b1fd1963efda9207a4e45c8fdc74225baf73a65b1db31","observation_id":"c95ab59d-13c7-41a6-8a74-498a687691d4","resolution":{"observed_at":"2026-06-29T16:23:39.879632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:440baa54e2a2ec90fbfbc0f82d96b60c0ff4760db89985bd57a1f39475acbb3a","observation_id":"58cd6d9a-78c7-44e0-9260-3917ea8b7bbc","resolution":{"observed_at":"2026-06-29T16:23:39.894622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:978aaa8b6a36487ef08f1a12af9a6e89e9b64600ecc5f0240cbf4324d1eee7c6","observation_id":"347fa992-b235-4df3-881b-b67243fca0b3","resolution":{"observed_at":"2026-06-29T16:23:39.902062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:767a6e15143812698da7f81f974d8fc13ca0348176691a675f96d71db28bed62","observation_id":"d4cc9a52-6e93-4129-aea2-5ad257ce243e","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:a7ac352d5603507f4d30bbc967958feef019bebfb4544b58ac9c40feb61ce5ab","observation_id":"4e8a8ee4-dbb3-4761-9014-a1fa9575a1e6","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:f1c0a3a310ea3f62721c43160ff08e079ef48c5a4c264d5374f926eb7d6296ea","observation_id":"9a69d9ec-fdcd-48f4-96aa-a05ef31594e7","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":"2601.15621","doi":"10.48550/arxiv.2601.15621","metadata_source":"pith","pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-TTS Technical Report","venue":"cs.SD","work_id":"6e1ae3e6-2062-4e44-a140-5c75409032cd","year":2026},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:ca45197ec9de3279977f1040e2dcca6fb508c8f959739b1b857bea2825146b22","observation_id":"6aff4cab-1178-49e2-983d-593eeb47c81a","resolution":{"observed_at":"2026-06-29T16:23:39.898947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-07-06T21:22:45.982350Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":"2505.07916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-07-04T02:49:24.877685Z","title":"Minimax- speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder","venue":null,"work_id":"54273fa8-90e2-4bbd-8703-905eed26289f","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:c18c2faf390553a88f3630910701d9cc36a8c7214d745a9ebfc036010d1ddf1b","observation_id":"15cdf836-4114-4b60-96f9-fb7dbc455bfa","resolution":{"observed_at":"2026-06-29T16:23:39.874719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:7ec8c6d4101c6cefc30c068a03e02ae4291d3a5df113a982549372bd0ac89ba7","observation_id":"bae82a65-2eda-43a9-9008-40446c8fd93a","resolution":{"observed_at":"2026-06-29T16:23:39.896818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:b096421ac9956121c18b1f03ea2333d5f57982658d1b54d7e1722ecb23488a01","observation_id":"f3f5e993-4f09-45f9-874f-4060a0592f13","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:644c83521b47d01b0c84648df946a20dba1fe7c4136486b079d772f354b5a7bc","observation_id":"d7ecd057-b6b1-4e10-9f0c-da38a15929c4","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:b7c7914b875d049de92866f410285d31d24500f79f1c13074c8b0be1d764d697","observation_id":"a88b261d-d9b4-4570-9773-fd17f1e1a673","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Hifi-gan: generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:011cfccb69aef223fe3238f4fe3b74d49483b9952922de648556df495632e492","observation_id":"f35dc089-a771-43f4-b9e9-0382b5eee44d","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:689020a03b83529219757d1d109c3aa0c940081dcca1f0e39d5d432d877134e7","observation_id":"67d633e6-77f3-47d0-b950-0e82a738897f","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"pyannote","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:ba1f37f37c686e86c0a85e562f06899fe66d9afdee0cf646e7c62afbcb8d3ef0","observation_id":"bcbb7191-fd24-491c-89d4-f14d98b195ef","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Dnsmos: A non-intrusive perceptual objective speechqualitymetrictoevaluatenoisesuppressors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:9244aedca170f04f820f97b61ef049d09c3dd5b7744e0a44dab0aa86257f0387","observation_id":"56b4bf75-aaf0-4e06-b077-49bab1a65fa4","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:ef56842bf98e01a2507557cd0a570ae7ccbd29b594f84c2a573980efa5e30e02","observation_id":"452882a0-345e-46aa-a953-ac45dbc28eeb","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14350","last_updated":"2025-01-24T09:21:41Z","snapshot_observed_at":"2026-08-05T01:17:13.454546Z","submitted_at":"2025-01-24T09:21:41Z","title":"FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration","version":1},"cited_work":{"arxiv_id":"2501.14350","doi":"10.48550/arxiv.2501.14350","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14350","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fir- eredasr: Open-source industrial-grade mandarin speech recognition models from encoder-decoder to llm inte- gration","venue":"ArXiv.org","work_id":"62974ced-2120-413e-8766-01dae954001d","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2501.14350","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:d1db44d009d902be5eddcfad3d57eb6700e6982708416e2904a0f355871516b0","observation_id":"49876449-2efa-40d3-9570-e9d683424d94","resolution":{"observed_at":"2026-06-29T16:23:39.871989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:1f0991ae7dc71b3cc8b0655e491498fde03f5d44112db7f906b13aae7d3a594d","observation_id":"8ca12b10-cfd6-4ff2-a840-3f98804c826a","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:a6c5236b3248c2e00f70e51d18e07c0ec3c7f0b12755b30b58b75b95e548cc21","observation_id":"6faba947-c387-4596-9ea8-02984d657d98","resolution":{"observed_at":"2026-06-29T16:23:39.892254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"3d-speaker-toolkit: An open-source toolkit for multimodal speaker verification and diarization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:f92fe62a0aeabfed81e21652907a30a6d76b38c313f559320c14be98bb9b8e6e","observation_id":"039fd3d2-cbc9-4dc9-98d2-9dbc676c9cf3","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Cam++: A fast and efficient network for speaker verification using context-aware masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:6743c31162a9528fb5af0ca6f80c0f40b5bcdd3a53c186932d96dfa55ba0d28b","observation_id":"684c4825-ec9c-41b0-9aa5-b0c38bcec73c","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:23cbe6665d7b2f05e16e8148d44e904d1b4397e8fd7f409322b76833b32d93dd","observation_id":"3d84b5f9-2bb2-44d5-b47e-e8381a32b754","resolution":{"observed_at":"2026-06-29T16:23:39.881950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"Towards efficient visual-language alignment of the q-former for visual reasoning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:378ee49526738129a93fbedf90fdc75296706bdf120a80c9a68d79586a3bd031","observation_id":"18c22e38-a338-4a3f-ad34-9c54977133aa","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T15:51:21.519785Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:ffcdfc3d6b25a7f9282d39cb5bd6912172b5cbd97400c95a0508575128fa0798","observation_id":"c4114d78-16df-4592-b387-291799c7c0fe","resolution":{"observed_at":"2026-06-29T15:51:21.519785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24650","doi":"10.48550/arxiv.2509.24650","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning","venue":"ArXiv.org","work_id":"191e619c-8028-43ca-952e-2aa85335d419","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:ec047c40aa5d10826e180f2ea91a4ee8a620c3dfc9bed7a70fb1e3f99b8407d9","observation_id":"dff122c5-eb64-4103-b03e-871c18861c87","resolution":{"observed_at":"2026-06-29T16:23:39.884569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":"2508.19205","doi":"10.48550/arxiv.2508.19205","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vibevoice technical report","venue":"arXiv (Cornell University)","work_id":"6d46a99d-ed41-4221-8fbe-35859ee85e2d","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:7b30c3d9616303b2c9377349fe3aed777c0cb246cd57dbd6f56ca9a8431bbbe0","observation_id":"6e69b4a6-473a-4562-947b-a0893f0fda82","resolution":{"observed_at":"2026-06-29T16:23:39.904655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:29:42.191088Z","title":"Fish audio s2 technical report","venue":null,"work_id":"91571db3-6f7a-4f09-b62f-7174bb3f83ce","year":2026},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:7853c6be30bec7dde65831ad888041dcc0234eeda50aa98cac74c665f78977b1","observation_id":"f04624a4-aa91-43ab-8770-f7a9e344cf83","resolution":{"observed_at":"2026-06-29T16:23:39.887587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-05T17:33:03.736753Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:6b186babec088983f27a5d753f32d47498f3bf940c763166dc96f1f525b57e18","observation_id":"ac48d7d0-7235-4016-ac85-5d345ec6882a","resolution":{"observed_at":"2026-06-29T16:23:39.890163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2605.27258."}