{"as_of":"2026-08-09T20:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc835aabbbb6b63561cce8253ad406bff99e2928d0906221ea281cd5b73d5d60","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:15:41.454335Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.16417/citation-record","integrity":"/paper/2606.16417/integrity","json":"/paper/2606.16417/citation-record.json","paper":"/paper/2606.16417"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:b5b1407ab2829104afa4d1bc8f66ddc71aba96567495b001a66c2893d8fa4319","observation_id":"2f9bebd3-fbfd-41fa-91c8-a841f811f197","resolution":{"observed_at":"2026-07-03T18:08:46.958536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:091e1f6c691c256bfd1efe7bcd95a7e0316b9646be26a6ecbd509d9ecb673080","observation_id":"b9a33956-6dad-46f1-9711-f7a52411cb98","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:272dca3521046bb3881a624d1e5efb7be141c87daec14b07c2f72b5a24f8c4aa","observation_id":"85c5fcf4-aafa-43b3-881e-6f170b4b0c79","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:e8cb4cadb4a8042ca47e8b03e4fbc9999165d25512d9ba77fa5ea12a75d27456","observation_id":"d9c188d5-f21a-4c39-a4b9-cec8d53f1de1","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-09T19:41:17.737989Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:d9e10693782817afe4be18e10976666bfe2b069002b0dbea57d8d6029a6db267","observation_id":"f4b6d5e9-3a04-4460-bec4-761851ae30b0","resolution":{"observed_at":"2026-07-03T18:08:46.949342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:a1fc50715f3d8a82297d08fa7016e99504c1cbb187431b7459e0f5dc53ecfb59","observation_id":"c83c0c63-cb90-42d8-827d-dff5dd9adeb3","resolution":{"observed_at":"2026-07-03T18:08:46.958514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:10d24bc30080312bdeceea6031bfa49e08074b5b4460c4c933bed139abb3bfa2","observation_id":"f0ef2729-683e-4fe6-965f-072aa067a56e","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Macst: Multi-accent speech synthesis via text transliteration for accent conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:bf247561486460654fed818927bbaf2e56d4ce64f692d53927bb980447f8f275","observation_id":"ddf91cb4-1cf7-4c16-9bff-9bb0cab197cb","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16850","last_updated":"2023-12-29T05:12:51Z","snapshot_observed_at":"2026-07-06T17:09:06.429946Z","submitted_at":"2023-12-28T06:37:52Z","title":"Accent-VITS:accent transfer for end-to-end TTS","version":2},"cited_work":{"arxiv_id":"2312.16850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.16850","snapshot_observed_at":"2026-07-03T18:08:46.943681Z","title":"Accent-vits:accent transfer for end-to-end tts,","venue":null,"work_id":"19a6985a-62d1-42ca-b074-6b6c7cb2a169","year":2023},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2312.16850","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:87a1a85b20e06a562d49ea9047dc6ee0fab3dfaaf41b078cc5cbe2fcb9cedf2b","observation_id":"8c739d33-eeb4-4b38-b121-3e12537099e2","resolution":{"observed_at":"2026-07-03T18:08:46.945348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"L2-GEN: A Neural Phoneme Paraphrasing Approach to L2 Speech Synthesis for Mispronunciation Diagnosis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:5911d674b9b83313d70dc6112df68364c99f8f56118cd20f450e78abaf981b3e","observation_id":"66566f92-d02f-45cb-a2d9-0778f3692911","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27273","last_updated":"2026-06-26T22:41:11Z","snapshot_observed_at":"2026-07-06T23:12:47.745700Z","submitted_at":"2026-04-30T00:05:03Z","title":"Few-Shot Synthetic Accented Speech for ASR Fine-Tuning: What Helps and When?","version":3},"cited_work":{"arxiv_id":"2604.27273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.27273","snapshot_observed_at":"2026-07-03T18:08:46.937217Z","title":"Few-Shot Accent Synthesis for ASR with LLM-Guided Phoneme Editing","venue":"cs.SD","work_id":"ae64fe8b-d3dd-4433-8f56-edc197d36ef7","year":2026},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2604.27273","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:674b4bfe66ba6e7a4e7f305b2b4109b0f81c0904028e0be5fc761e5dd9d17aed","observation_id":"9cb421b7-4b9d-44ad-b43c-246eb5b90b1d","resolution":{"observed_at":"2026-07-03T18:08:46.938729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Scalable controllable accented tts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:3c780bd5b3b087f2ff12600dc77e2dff3e456a401ca85f009abdf424d0a495d2","observation_id":"3d1e8161-ebd2-4973-9e10-25181bbfde86","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Controllable accented text-to- speech synthesis with fine and coarse-grained intensity rendering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:5d366f08324d45334bf7427535860caf045377144d3b49ef71bd0aaaebe37c23","observation_id":"ae13f620-be02-4072-97fc-541ad66801b5","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13342","last_updated":"2024-10-17T08:51:46Z","snapshot_observed_at":"2026-08-09T15:18:25.861645Z","submitted_at":"2024-10-17T08:51:46Z","title":"DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2410.13342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13342","snapshot_observed_at":"2026-07-03T18:08:46.953813Z","title":"DART: disentanglement of accent and speaker representation in multispeaker text-to-speech,","venue":null,"work_id":"7bf454d4-3dcc-40fd-a206-14965a3f7cfd","year":2024},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2410.13342","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:903f6c7de37173a6eaa689c818fe281dd6273aa6b8d710ab933ab5d1aecbc12c","observation_id":"e653925e-4724-439d-8124-ad4a5e3b32bf","resolution":{"observed_at":"2026-07-03T18:08:46.955633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"RAD-MMM: Multilingual Multiaccented Multispeaker Text To Speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:a07689da5406cf6077530c35e41b4ad5e9f7b1f5e750a203521428cca9cdb69e","observation_id":"3f634226-f788-4357-9e34-9da8eea8df09","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:0b6203eac0d8a627f1542b79a7115ba1850a11fa483d4cb0b2fc8139c837100d","observation_id":"3c6b3035-c5cc-4e43-adb6-dbe1bc5a070b","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Unsupervised domain adaptation by backpropagation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:59466201d5fde133de847f6f8b3fbfdb062bf0dfeac5b41cbbc0e3d62ea26abd","observation_id":"b60e8067-62cc-4fc2-add7-5e48868d6342","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Natural TTS synthesis by conditioning wavenet on MEL spectrogram predictions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:f965e8beecd853482e3099d4f418c720152cfe00665a3ac25d38008a3b7d90ff","observation_id":"2d79462a-0ce7-45cd-8803-b5b37c83efc4","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Adaspeech: Adaptive text to speech for custom voice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:b4628320dd7fe6a4be18569b1f04302ee2485860164e843337a623861300ba1c","observation_id":"58df358f-9600-450d-a730-92629eae7b43","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Glow-tts: A generative flow for text-to-speech via monotonic alignment search,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:37107093ba316c5513552457819d553439760a73c39a4c65ad03bd9c021fe28e","observation_id":"c0f5472c-224d-43c2-8f90-6932194baf50","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Con- former: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:9478269ebf7bc8ed071f5a6aabc43bb6d3bd5f3488af53cfaf78691533974f74","observation_id":"347a8adf-719c-45e0-8889-fea43ea76af7","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Accentbox: Towards high- fidelity zero-shot accent generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:6844fe12e8e595f7729e75bb7ad8b330fe28653a881a52804d0f5671e77659d8","observation_id":"e39af0fb-5523-4cbe-8d50-811a253700ab","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:86dc8a3545a26330594b0f95251ca43ae626d55cde5f0dd4077ea5160e41f29e","observation_id":"9fbda8ed-d6c5-420c-a552-861d8ecdcf62","resolution":{"observed_at":"2026-07-03T18:08:46.952252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:01319cb5536e730ccf3a52ec07653c7a4a53511b7de0490e0ccf806e94a0eab0","observation_id":"1aaf27e4-99a4-4c2c-a114-f3dce8d6a714","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Parallel wavegan: A fast waveform generation model based on generative adversarial networks with multi- resolution spectrogram,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:d869e89944738c030ca1edf03a0e2d89bfea446bb2b9202d3b9d658894e1aac6","observation_id":"6d2c69e8-7fec-44f8-944e-486a25129a83","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"AISHELL-3: A multi-speaker mandarin TTS corpus,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:cfaccccb45ac2d25031b89515b9998affb45c38e2c4d40144a0ba53dff9afbcd","observation_id":"1ac402c1-8ddf-4dc5-b291-d4d89fc83152","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:8c3a6ca47cb8b40687428e52ff08731f4f3b1bab32bf6e980d254f5347e28d2d","observation_id":"9140cea1-da72-4a91-87f7-7810f8eade45","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:282e4cbe6a165a5d2afc17bd4f76d820a692b0fb15fc39e5427a08e430512d8a","observation_id":"bb663951-e853-45e6-b920-25a2fad96287","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"Amphion: An open-source audio, music and speech generation toolkit,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:6ce3a5b045321bd40f2be3eb20ae229a05fe305ba4ba4f000f93b4577b8e39d4","observation_id":"66f881d6-4399-4211-9ab9-77dba00ac3fe","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:15:41.454335Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:c785f9a632bcbf408f58f6360c40235d41f7558740c63a76c50ebf7fc0ea799e","observation_id":"6887fa67-7c13-4173-8bc5-8bcb0745a79d","resolution":{"observed_at":"2026-06-27T03:15:41.454335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-08T16:08:45.949013Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:2a322940cda3f0d6726198c5b038e66e2c2a336eb9f3e4e2355e63b5db8376c8","observation_id":"896a6cdb-57b1-4ece-a285-f505c582e8c8","resolution":{"observed_at":"2026-07-03T18:08:46.955943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2606.16417."}