{"as_of":"2026-08-08T05:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cdee71c1eb97cf08500d1253d547d765c1661e5264ffeb1f31dc44a9f607ae5","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T00:09:35.661121Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:49:29.459675Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-25T00:10:07.071622Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":"1907.04448","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","venue":"cs.CL","work_id":"31f4c481-def2-4dc6-801c-98bda5509273","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:fd3e144026d4c0e159886696fc90d5ac005301e94646a4e24dd3bc053782afe8","observation_id":"6fd71456-8b9d-4435-b97c-96a539929a35","resolution":{"observed_at":"2026-05-25T00:10:07.075022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-06T23:49:29.459675Z","title":"Weiss, Heiga Zen, Yonghui Wu, Zhifeng Chen, R","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.459675Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:37cfc8745eafd327dab5878d855ad6d677a2d205d171950d21d4df56811fd331","observation_id":"d54c8481-fba0-4c4e-bfaa-35dfdcb78861","resolution":{"observed_at":"2026-08-06T23:49:29.459675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-05T22:17:38.408435Z","title":"Learning to speak fluently in a foreign language: Multilingual speech synthesis and cross-language voice cloning,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.408435Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:849866967507669b7c750d8641a763cbdfcaa1336a672163d418de357fbfd666","observation_id":"b5f15223-498d-4312-b7d4-6d7df3408c0e","resolution":{"observed_at":"2026-08-05T22:17:38.408435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1907.04448/citation-record","integrity":"/paper/1907.04448/integrity","json":"/paper/1907.04448/citation-record.json","paper":"/paper/1907.04448"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"prosody, by conditioning synthesis on la- tent representations [8–12] in addition to text","venue":null,"work_id":"f2c5a045-9618-4ecd-9fcc-93af60422a1c","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:709810d7adff6d3abcd108f385257db3fd0095a4b1eb54dc68f595aaeae1d64c","observation_id":"7ae3d3a5-6cbd-4435-b177-51c8f00bf4b9","resolution":{"observed_at":"2026-05-25T00:10:07.660334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":"1907.04448","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","venue":"cs.CL","work_id":"31f4c481-def2-4dc6-801c-98bda5509273","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:fd3e144026d4c0e159886696fc90d5ac005301e94646a4e24dd3bc053782afe8","observation_id":"6fd71456-8b9d-4435-b97c-96a539929a35","resolution":{"observed_at":"2026-05-25T00:10:07.075022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ddf4d886-2992-4521-92a8-201a8ccee6f8","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:74e39d4e9db64c5d7357b43c68988ec5c921a83255e609e3afe38595fa9aa724","observation_id":"6cfd8f0d-51a0-4201-b5a4-346c0b1007e9","resolution":{"observed_at":"2026-05-25T00:10:07.642502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"heavyaccented","venue":null,"work_id":"6fe05467-27d0-4f76-9bd1-32c0c5111e57","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:8b9e9b16ca3f0b29fe6838094495961eb2355902a997446529fffa972260febc","observation_id":"fa48e1d4-4bc6-477f-925c-40da5a1e5ccf","resolution":{"observed_at":"2026-05-25T00:10:07.589630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4f38f264-f2b4-4720-bf51-8c973ccd370d","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:930d7a57e1edb8b8706f32a76450395d01dbc27e1d9317aeea4342d4795da620","observation_id":"0cb291dc-c2f5-4781-906a-d237027c3a92","resolution":{"observed_at":"2026-05-25T00:10:07.648339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7c4e4e4f-62b4-4bd5-b771-1c0e77790fb4","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:2a90e72ff2117191e874182b3c91aae22d547edffc9cdee192c05d7c8568e789","observation_id":"13dd437f-953e-4e43-9586-426de24c3f0f","resolution":{"observed_at":"2026-05-25T00:10:07.680552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:079cb3d59b3c5e31e150469003cbddcfccbea1f8dee985ae8b1559294c9786d5","observation_id":"dad61d25-0bb5-4b23-9366-265181562df0","resolution":{"observed_at":"2026-05-25T00:10:07.041425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tacotron: A fully end-to-end text-to-speech synthesis model","venue":null,"work_id":"44311454-4b41-4691-82f2-653a2d8087ee","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:1205a5badf39f273c1908d762e991e6689361e558d9cf3ced45f5658755aa784","observation_id":"da5c7525-49ce-40ba-b433-1f8767d18ee9","resolution":{"observed_at":"2026-05-25T00:10:07.576486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepVoice2: Multi-speakerneuraltext- to-speech","venue":null,"work_id":"80dc8cd2-3b7e-401f-8341-9485fb782506","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:1ee3c6208eabc78f12dbffffe837ce57d70de91337422cfdcf59c6866c99050c","observation_id":"4a71613e-5913-4fa7-8311-5a843e6d3c49","resolution":{"observed_at":"2026-05-25T00:10:07.572278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neuralvoice cloning with a few samples","venue":null,"work_id":"a86d4613-9ed0-4135-9d4d-613f26052cab","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:710f7bf9517036c7ce8ad5cbb56df82598e80c94fd9d2b32e9795bc9dbfec279","observation_id":"b6187871-b060-4c34-adce-e4132faea9e0","resolution":{"observed_at":"2026-05-25T00:10:07.667956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfer learn- ing from speaker veriﬁcation to multispeaker text-to-speech syn- thesis","venue":null,"work_id":"42a0c2c6-d249-42fa-83c4-cf619fbf1b28","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:cd226b7368b8253fff75f30fdad367e743eec6472a8375c269ba33135c2ed032","observation_id":"f73a218d-7ba3-46ec-ba2c-d62a60168311","resolution":{"observed_at":"2026-05-25T00:10:07.602137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fitting new speakers based on a short untranscribed sample","venue":null,"work_id":"311ba02d-2286-4122-922a-21f8fc587646","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:dfcbf44264445474b91dc261583c6e84d5c327fc1190b3ac7e84784612627740","observation_id":"463ce1de-833a-4c65-bdd9-02d7ffd90e7f","resolution":{"observed_at":"2026-05-25T00:10:07.672328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10460","last_updated":"2019-01-16T22:30:22Z","snapshot_observed_at":"2026-07-06T07:04:39.537654Z","submitted_at":"2018-09-27T11:31:19Z","title":"Sample Efficient Adaptive Text-to-Speech","version":3},"cited_work":{"arxiv_id":"1809.10460","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.10460","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample Efficient Adaptive Text-to-Speech","venue":"cs.LG","work_id":"69b6ec8d-83c9-46e2-93e6-e18c61e78962","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1809.10460","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:e3296e3102d7f8a4d35bf2427ade44d54be56e4b35c2b533034d216117c29d2f","observation_id":"50f1348c-36f9-4db1-9bd1-b67c37892f87","resolution":{"observed_at":"2026-05-25T00:10:07.062820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Style tokens: Unsupervised style modeling, control and transfer in end-to-end speechsynthesis","venue":null,"work_id":"88d4bded-8749-4756-baa1-f3f27250969a","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:d3a5fa0399e27ac8cb745e5f5492e4aad07419a9fc74985881117e5b4dd01d87","observation_id":"1546fa51-115f-4a65-97e2-6a89c39779eb","resolution":{"observed_at":"2026-05-25T00:10:07.605944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards end- to-endprosodytransferforexpressivespeechsynthesiswithTaco- tron","venue":null,"work_id":"2136c01f-3f6b-40f4-9c10-efb4d1ae6ace","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:abb964dd0f3654d526c7ab7790f996f47883f64f7e0930061aef02f3c81c6db5","observation_id":"4e89d297-4da6-4fea-a261-56f9edce538e","resolution":{"observed_at":"2026-05-25T00:10:07.618551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expressive speech synthesisviamodelingexpressionswithvariationalautoencoder","venue":null,"work_id":"677288c4-1eab-4695-9c38-d82fa007bbd8","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:2e429bffd248870ce01510104a7c32b0a3c6ca208eafc0d4c95db3cd24d37048","observation_id":"82dfebc3-3a6a-44a0-a101-eff418e3ecf1","resolution":{"observed_at":"2026-05-25T00:10:07.626764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.11470","last_updated":"2018-09-09T17:01:07Z","snapshot_observed_at":"2026-07-06T06:53:08.668874Z","submitted_at":"2018-07-30T17:59:28Z","title":"Deep Encoder-Decoder Models for Unsupervised Learning of Controllable Speech Synthesis","version":3},"cited_work":{"arxiv_id":"1807.11470","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.11470","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Encoder-Decoder Models for Unsupervised Learning of Controllable Speech Synthesis","venue":"eess.AS","work_id":"d5b1e792-4a5b-4808-9a17-b53a83ed926b","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1807.11470","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:02ef16f72733e8203a4bf5198b21bf83f156652930ff2368d77e48b8d71717e9","observation_id":"9ba06a2b-ac69-44c8-8be9-d88c3e4cc5f6","resolution":{"observed_at":"2026-05-25T00:10:07.055571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical generative modeling for controllable speech synthesis","venue":null,"work_id":"3186b54f-c45c-4696-bdd2-50ba42ca6af7","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:960f8a62d5bf9b79b5a61b6cc99e8f2c884d5ef272788467aee1fdf7e45b42e7","observation_id":"743c9309-9d1c-40f6-af1a-c75a2ed2f734","resolution":{"observed_at":"2026-05-25T00:10:07.594414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical parametric speech syn- thesis based on speaker and language factorization","venue":null,"work_id":"1a30cf79-1580-45de-957e-d743a141e014","year":2012},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:77c2529a5a4b54db07d4666ff0c63f71a9d8102eb6692578d4a26f83da7fa90b","observation_id":"60b12332-d185-49e3-8474-e24b70eafd40","resolution":{"observed_at":"2026-05-25T00:10:07.598354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-language multi-speaker acoustic model- ingforLSTM-RNNbasedstatisticalparametricspeechsynthesis","venue":null,"work_id":"29c7b9d2-d480-44ec-9458-3419165d5a91","year":2016},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:bbf313f3e6f86a2cc16580fdc4365b5053cb28e4dcb179e58748ddd7bde2016e","observation_id":"bcdd3e0e-eea6-43b6-b75f-ad844e25f929","resolution":{"observed_at":"2026-05-25T00:10:07.609809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A light-weight method of building an LSTM-RNN-based bilingual TTS system","venue":null,"work_id":"33f43491-c355-44d7-a6d9-d122f07986c6","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:eaf2ca9d2e64376e90b88a5cef6963abbb3dd7941b764ecc35a049de8c6302b2","observation_id":"fa1e41ff-b3e3-4599-ba23-1f2a46f9ef41","resolution":{"observed_at":"2026-05-25T00:10:07.614306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09364","last_updated":"2020-06-24T00:57:25Z","snapshot_observed_at":"2026-07-06T07:16:33.611269Z","submitted_at":"2018-11-23T05:24:15Z","title":"Learning pronunciation from a foreign language in speech synthesis networks","version":4},"cited_work":{"arxiv_id":"1811.09364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1811.09364","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning pronunciation from a for- eign language in speech synthesis networks","venue":null,"work_id":"f18641c4-a7c5-454e-af4d-17a4c8987717","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1811.09364","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:cc4acfda4600b70bc7e602d8b3b918af08865d5271b44268e387d474ce117000","observation_id":"0835da2a-2a5b-47f4-a6b5-5bf4cae7d335","resolution":{"observed_at":"2026-05-25T00:10:07.048463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervisedpolyglottexttospeech","venue":null,"work_id":"4501bceb-5906-4116-952b-3d37436156d1","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:f207779941a173e9502440e69cf08e5c7fe4857a6a4dd0892a9e5302b95d0f01","observation_id":"9cb4e778-c9bb-4a9f-8c20-c173c7e27d25","resolution":{"observed_at":"2026-05-25T00:10:07.676164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WORLD: a vocoder- based high-quality speech synthesis system for real-time applica- tions","venue":null,"work_id":"c58bfbae-e153-4708-93b9-50e4231c42f6","year":2016},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:275b66401de9f9d28e9aaa1e3a62a2cad71d93d146aa7a297147fdccdb0ce011","observation_id":"343089da-d838-405c-abdc-153c89ec3e02","resolution":{"observed_at":"2026-05-25T00:10:07.664180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bytesareallyou need: End-to-end multilingual speech recognition and synthesis with bytes","venue":null,"work_id":"06abe7e9-2a39-4ae4-86ae-e0756f9d1d6d","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:cbb40f20e6a3033290280a684c24c6754c38f8e904e13ff6abd6b9980f0c7835","observation_id":"21e1c771-0432-47df-b516-f1a73f85d01b","resolution":{"observed_at":"2026-05-25T00:10:07.638343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural TTS synthesis by conditioning WaveNet on mel spectrogram predic- tions","venue":null,"work_id":"84ea58d9-ceb5-4dbc-819b-441afe9646fc","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:9e776f419db82534a158e6479eba5477b52a4cda8a138890028a440b59cfb9b4","observation_id":"0c01e1a0-242a-4369-9fc8-35d5b94496fe","resolution":{"observed_at":"2026-05-25T00:10:07.652174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-encodingvariationalBayes","venue":null,"work_id":"410d7857-c169-48db-99df-8e51cac6f951","year":2014},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:8465966ab3492117cba04857b0f1f72fb861dd40285a817b243975872cbba665","observation_id":"1ef0ec5c-fd0e-462e-b864-08100d5ee0b7","resolution":{"observed_at":"2026-05-25T00:10:07.656015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eﬃcient neural audio synthesis","venue":null,"work_id":"bfd6918f-f591-4d97-a566-aff5bdc4b3de","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:64b7cbeb41ea6f79a01f78621d7a4f6d9adbc9cc3189a60179d0d206e42d5f33","observation_id":"ca15ffc2-a01b-4c46-9772-50af92048019","resolution":{"observed_at":"2026-05-25T00:10:07.695580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Char2wav: End-to-endspeechsyn- thesis","venue":null,"work_id":"03be463a-a31c-426e-896e-c544ff70b16c","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:18cb4b5a31032725c5f3ce2d532a770f9d0e6a1d9ce047ad6022b98f44ea047f","observation_id":"586a05dc-7512-40bb-af36-0f5f68adfad3","resolution":{"observed_at":"2026-05-25T00:10:07.622605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Voice 3: Scaling text-to-speech with convolutional sequence learning","venue":null,"work_id":"bf1d1397-1c5a-4ae8-83e3-93f9ed30664e","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:f4d79e9717080054452570d573f836d86cc30f9d6183a5e19605c35df01793e0","observation_id":"79bd0c19-510b-4d92-b149-7d37f90d1262","resolution":{"observed_at":"2026-05-25T00:10:07.684223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07240","last_updated":"2018-11-24T23:16:10Z","snapshot_observed_at":"2026-08-03T17:44:27.124626Z","submitted_at":"2018-11-17T22:45:15Z","title":"Representation Mixing for TTS Synthesis","version":2},"cited_work":{"arxiv_id":"1811.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.07240","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation Mixing for TTS Synthesis","venue":"cs.LG","work_id":"8847a751-58e1-4f8e-a7aa-842cc5d113d7","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1811.07240","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:fba476b69964f3f764adf101abd9cd920241b8e5602dc0bc1d4ca7cde90dde60","observation_id":"6f3d1a08-bbbf-4049-b058-c4a0b3db7883","resolution":{"observed_at":"2026-05-25T00:10:07.068668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data-oriented methods for grapheme-to-phoneme conversion","venue":null,"work_id":"a25ed463-92cc-436f-818d-7e991d6953d4","year":1993},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:e22f949ff48091b06d3e84d7ecd2d12f9e585b51e0b8a359d611b81d46093714","observation_id":"bc52e1f1-98cb-413c-8928-22b3002d98e4","resolution":{"observed_at":"2026-05-25T00:10:07.631868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain- adversarial training of neural networks","venue":null,"work_id":"de1c0471-b441-46fa-b0c5-1ce09c88c27f","year":2096},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:51a194e60131c321ddb07119f92e3739e5ce54f69ddcb9cc77bd69abb71915e8","observation_id":"99409a6a-0220-44ba-8d48-ba0d1edc939b","resolution":{"observed_at":"2026-05-25T00:10:07.687837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling correlated speaker and noise for speech synthesis via data augmentation and adversarial factor- ization","venue":null,"work_id":"b46d2d9c-dce0-4657-b746-c3836a754c01","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:c51cdbe9971699a3aadf3f969a21926c54caad52357dba7300f03b11ea58825c","observation_id":"d10ac97c-0db0-4a90-bd2b-2e4c23a7c895","resolution":{"observed_at":"2026-05-25T00:10:07.691566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-lingual speaker discrimination usingnaturalandsyntheticspeech","venue":null,"work_id":"b063752b-350a-47a7-aaf8-06ffd28f2b04","year":2011},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:c00cef0be31265cff4ae7e4c5f773c92cdf49c8ee957ea2413f6157b6af21f2a","observation_id":"bd3acc62-3653-41ab-9dda-91fbb8c19d58","resolution":{"observed_at":"2026-05-25T00:10:07.584968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized end- to-end loss for speaker veriﬁcation","venue":null,"work_id":"95129d2a-8376-4fe3-9b65-fe35bc30ac06","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:166b797d3d10701dee7b92d1c24d3504d9731443fbd91fa80c49bcf867f29afb","observation_id":"900e2af5-09e5-4d88-b18d-184bac19d2a1","resolution":{"observed_at":"2026-05-25T00:10:07.580729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":5,"verified_fuzzy":27},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:1907.04448."}