{"as_of":"2026-08-07T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:825e4cad29d8275fdc8f96b6849d1b2cd5efad4e4bea4a9c96d19ae868943344","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:10:25.911203Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:35:51.971819Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07080","snapshot_observed_at":"2026-08-03T08:35:51.971819Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:51.971819Z"},"links":{"cited_paper":"/paper/2606.07080","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:d8c4b32f8b141d31df5191bba352f5175ae3dab6f35542e9acf17e430a7b911c","observation_id":"7e2e26bd-231f-4cdb-bcc0-08895295bebb","resolution":{"observed_at":"2026-08-03T08:35:51.971819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.07080/citation-record","integrity":"/paper/2606.07080/integrity","json":"/paper/2606.07080/citation-record.json","paper":"/paper/2606.07080"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2604.00688","doi":"10.48550/arxiv.2604.00688","metadata_source":"pith","pith_arxiv_id":"2604.00688","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","venue":"cs.CL","work_id":"db2833b9-b8a3-4aea-ad24-159041747264","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2604.00688","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:bc0a6d7f628d2051c3afa3d2ef2cb22974b89a5345328b04ee358c9d003e04e2","observation_id":"a227bf2f-6592-466b-9663-aec08fa98698","resolution":{"observed_at":"2026-07-02T19:57:20.086928Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.29339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:57:20.082708Z","title":"Longcat-audiodit: High-fidelity diffusion text-to-speech in the waveform latent space","venue":null,"work_id":"3268c6b6-1911-40ce-b434-ea86719d30a2","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:b97c41c847ad256927b228aa57f565613868a2b5e68809b5306301fbf2f850d9","observation_id":"d8150420-e9be-4467-9b82-fef24412903f","resolution":{"observed_at":"2026-07-02T19:57:20.084190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:4206c28026346bfa2041be5b3dbdda80092a55f5e924dba5b3c8a4b2f24fed33","observation_id":"f77e995f-57c2-4b82-baba-14104bf02e86","resolution":{"observed_at":"2026-07-02T19:57:20.078690Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":"2601.15621","doi":"10.48550/arxiv.2601.15621","metadata_source":"pith","pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-TTS Technical Report","venue":"cs.SD","work_id":"6e1ae3e6-2062-4e44-a140-5c75409032cd","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:3e546262bc0b673b9b294ebe2f44dd1f6456925fc268bfda5c038e201a161dac","observation_id":"225c645c-38b0-424d-9aa8-3d8c79502e02","resolution":{"observed_at":"2026-07-02T19:57:20.067543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":"2508.19205","doi":"10.48550/arxiv.2508.19205","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vibevoice technical report","venue":"arXiv (Cornell University)","work_id":"6d46a99d-ed41-4221-8fbe-35859ee85e2d","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:eb986c3e38b4e48f8c4f1c4858ee5904245abc5bed4ba32ec7e69ca9243160e8","observation_id":"acec61fb-0e67-4519-b0db-1c0c0d69e4f3","resolution":{"observed_at":"2026-07-02T19:57:20.073533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24650","doi":"10.48550/arxiv.2509.24650","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning","venue":"ArXiv.org","work_id":"191e619c-8028-43ca-952e-2aa85335d419","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:495b82a3e7486a1908c0a454e9c11336d0239acfc520d64ded2ee8043b7eeb5d","observation_id":"3209b1e8-4ec5-4a6a-975c-a756751fd2ed","resolution":{"observed_at":"2026-07-02T19:57:20.057816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:5e6708af536304b283aa478ef92f97e5f16275b949983e41bc89fcdc6b2b2f9e","observation_id":"efba0c9f-6502-4976-9253-af1178854f41","resolution":{"observed_at":"2026-07-02T19:57:20.039783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19798","last_updated":"2026-04-03T08:41:19Z","snapshot_observed_at":"2026-07-06T22:49:52.077931Z","submitted_at":"2026-03-20T09:37:54Z","title":"Borderless Long Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2603.19798","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.19798","snapshot_observed_at":"2026-07-04T08:29:42.183762Z","title":"Borderless Long Speech Synthesis","venue":"cs.SD","work_id":"c48ff498-46d5-4e48-8e64-13e1c2fe65a5","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2603.19798","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:cd9fa4487ea286b7cfde6dfe6d476564d22260f6e277fe0a46bc1c8af82937b1","observation_id":"34453ff6-37d0-474a-ba2a-82c01b6763b0","resolution":{"observed_at":"2026-07-02T19:57:20.089737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29948","last_updated":"2026-06-01T07:03:07Z","snapshot_observed_at":"2026-07-06T23:39:20.085961Z","submitted_at":"2026-05-28T13:55:19Z","title":"HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2605.29948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.29948","snapshot_observed_at":"2026-07-02T19:57:20.058675Z","title":"HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding","venue":"cs.SD","work_id":"221cda97-d2e0-4367-824b-5d98536ac210","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2605.29948","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:df4c2de71c3f32303bff5ecfe296f0ef2aae48716d449622a0a2ee9bc5034c61","observation_id":"0fa92e1a-041f-4bd0-a519-4c4aa1fe2098","resolution":{"observed_at":"2026-07-02T19:57:20.060177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12617","last_updated":"2026-04-17T10:49:33Z","snapshot_observed_at":"2026-07-06T23:00:46.620106Z","submitted_at":"2026-04-14T11:45:15Z","title":"SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models","version":2},"cited_work":{"arxiv_id":"2604.12617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12617","snapshot_observed_at":"2026-07-02T19:57:20.062235Z","title":"SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models","venue":"cs.LG","work_id":"25e37917-e888-41f7-869b-87af1d9c2b6e","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2604.12617","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:fc34d5a7047df5f195610449e1e71b1192116b76643f4c7a44464b90840a93be","observation_id":"a4cabc65-01f3-4afe-a009-3bd74711a548","resolution":{"observed_at":"2026-07-02T19:57:20.063637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:8b94f22aa4a9dd4e1f5e3eb35cbbef1c36a6484650bdb645b18eaf29f776b6ec","observation_id":"5826c81b-871c-4474-8f24-be0c20aeceb9","resolution":{"observed_at":"2026-07-02T19:57:20.079050Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:fca9610ebf7713957838d8e25925d507a856902e112e832c13df968c079e7674","observation_id":"d2ae9d75-0bc9-4f8c-b763-dce5fdfe8bc9","resolution":{"observed_at":"2026-07-02T19:57:20.054732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:cc325524aaf3c2b69a9ca0c021e1c878706f829b04c8b43764c9f194159f366c","observation_id":"dd263aa1-7927-49e5-9d92-a2a16a60a19e","resolution":{"observed_at":"2026-07-02T19:57:20.062535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:23ef0864ff06ba7901d19505f0879e634e2a6c0b893cfe6bc133608be61197b7","observation_id":"4af40350-8541-4072-9114-7128ce4677d3","resolution":{"observed_at":"2026-07-02T19:57:20.057397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:29:42.191088Z","title":"Fish audio s2 technical report","venue":null,"work_id":"91571db3-6f7a-4f09-b62f-7174bb3f83ce","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:c2874741813d1123586a0aedd67b4baabeea33008a7dc3c3f69b68c6d2783d87","observation_id":"50b6787f-db3d-4ff6-a9c9-ceeef55efee3","resolution":{"observed_at":"2026-07-02T19:57:20.054829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T17:47:52.715877Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:88af8992779eae5e46c071f8c6371cf511fe76f2a108d4d92172c627c689934a","observation_id":"d62cfc91-7398-45ee-acda-3dc9648f1de1","resolution":{"observed_at":"2026-07-02T19:57:20.051412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-07T07:10:18.010065Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":"2506.23325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-02T19:57:20.080166Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs","venue":null,"work_id":"453b7eda-caeb-41c4-a224-0efdd79e9820","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:fb3665850a97d76ab7d305684221a3ff1afbe6c14b090875560b9b22c3357b33","observation_id":"da31b60e-9d12-4c5a-ab33-74f6270c59ac","resolution":{"observed_at":"2026-07-02T19:57:20.081577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-07-06T19:07:37.761860Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":"2408.16532","doi":"10.48550/arxiv.2408.16532","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":"arXiv (Cornell University)","work_id":"741e6211-2d3b-4919-9f16-69a36a37a1df","year":2024},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:fe6e6cc93a984d10912aaeef3d4f93b02adbb68add7eac4a60b7e319d03eab32","observation_id":"951413b5-1f55-4636-91a8-be5539f7f333","resolution":{"observed_at":"2026-07-02T19:57:20.076261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-07T17:49:42.104594Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2502.04128","doi":"10.48550/arxiv.2502.04128","metadata_source":"pith","pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":"eess.AS","work_id":"7e72b079-ae3c-4584-aead-bab435ab5950","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:b1345a582b6ceae350ca2d9c9dd3350285001ab1931eba017ef6e3a6b4c5f381","observation_id":"f1567a9c-9f66-4bd0-be6c-4c6bf270299a","resolution":{"observed_at":"2026-07-02T19:57:20.070722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.830598Z","title":"Ming-uniaudio: Speech llm for joint understanding, generation and editing with unified representation","venue":null,"work_id":"11c153e9-984d-4efa-a9d8-c056545c0042","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:0461785bacfc85239e1e69120bc3b8fc44fa77b25a11fbc2c3b93bc620527209","observation_id":"a2908299-c8be-4a81-99a4-116b80418312","resolution":{"observed_at":"2026-07-02T19:57:20.067246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:07.015791Z","title":"vllm-omni: Fully disaggregated serving for any-to-any multimodal models","venue":null,"work_id":"11eb1840-40c6-4f3c-8f6a-53422545f9d8","year":2026},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:44222fa8c73cba05f52b8cfdd0fd310ca1721073944efaa458039a387942b439","observation_id":"293b4a13-3d26-4be9-aec4-7e6fc43bdeff","resolution":{"observed_at":"2026-07-02T19:57:20.065221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2606.07080."}