{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5944664d4a529e65c763853833be799dd7871cf9ea8a95ded1e47acf1d6f9d7f","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:08.477884Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:04.712156Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:18:09.431567Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"cited_work":{"arxiv_id":"2505.19384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19384","snapshot_observed_at":"2026-08-07T14:18:09.431567Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","venue":"cs.CL","work_id":"34708acf-5c04-4dc3-a9fd-905bca875b11","year":2025},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.712156Z"},"links":{"cited_paper":"/paper/2505.19384","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:1d5f0a2946cf9d11d7011be2d838bdb1ec2a66154dccf15300813ec4b58a437d","observation_id":"ce835dec-c20b-42c4-a41d-7727afbeac8c","resolution":{"observed_at":"2026-08-07T14:18:09.543726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19384/citation-record","integrity":"/paper/2505.19384/integrity","json":"/paper/2505.19384/citation-record.json","paper":"/paper/2505.19384"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"cited_work":{"arxiv_id":"2505.19384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19384","snapshot_observed_at":"2026-08-07T14:18:09.431567Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","venue":"cs.CL","work_id":"34708acf-5c04-4dc3-a9fd-905bca875b11","year":2025},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.712156Z"},"links":{"cited_paper":"/paper/2505.19384","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:1d5f0a2946cf9d11d7011be2d838bdb1ec2a66154dccf15300813ec4b58a437d","observation_id":"ce835dec-c20b-42c4-a41d-7727afbeac8c","resolution":{"observed_at":"2026-08-07T14:18:09.543726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:13.243410Z","title":"We introduce a gradual style encoding method to obtain multi-level style conditions","venue":null,"work_id":"e644f0c3-74c7-439c-8904-0e3d0b755ec2","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.825643Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:1b1bcc4496c16172933c0599d839ec49c5a2644eea35e81e7146f33bcd2f3727","observation_id":"7aacea6c-3adf-47c1-80c9-6cc4fb0949de","resolution":{"observed_at":"2026-08-07T14:18:13.292857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:13.045375Z","title":null,"venue":null,"work_id":"42857325-8999-4d33-8070-3e41f0bd7d9a","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.943618Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:ab62266477e5a4b8af02c2f35c5af739b843099d645edeee3f869f85af4e0fd0","observation_id":"c25a0baa-7a0e-42b4-91f0-d0b1ac87cad8","resolution":{"observed_at":"2026-08-07T14:18:13.145865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.931038Z","title":"Ask her to bring these things with her from the store","venue":null,"work_id":"32d3f5f1-f5d0-459d-bb15-2abd327d2902","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.074261Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:6e304bd365b287faf45ea6e1c4e5022b0ac37256b5943ac2ff0bac88d1de8165","observation_id":"50062a17-ee7c-4a97-b88b-2d31e88a67a7","resolution":{"observed_at":"2026-08-07T14:18:12.976898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.791411Z","title":"Throughout the experiments, GSA- TTS shows superior audio quality in terms of naturalness, speaker similarity, and intelligibility compared to existing zero-shot models","venue":null,"work_id":"77129878-a095-4dd7-94fe-ddde15e61611","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.187510Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:a2cf798dd04ebfad3c21f32acc37ca69b2f8060c02df2d9a0f5d72345ffdefc9","observation_id":"83f7f23f-75c4-4562-b17c-c4e36e6ab778","resolution":{"observed_at":"2026-08-07T14:18:12.861566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-07T14:18:05.286666Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.286666Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:6ee8f2002a6dbd5d652ff79a97e29c0f551e9f3c9b693618582acda0ffa846a0","observation_id":"32086888-a169-42fb-9990-eb63c61fa8d8","resolution":{"observed_at":"2026-08-07T14:18:05.286666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:05.379053Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.379053Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:c9604546802c8e8054dcb227e3a97c15f723de3c110b834f2f5f3a9b812741ca","observation_id":"34a60102-c26d-4e55-8f67-a75a302b5731","resolution":{"observed_at":"2026-08-07T14:18:05.379053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.568975Z","title":"Conan: A complementary neighboring-based attention network for referring expression generation,","venue":null,"work_id":"ceb69103-6ba3-4e7f-bd63-d12179f6f5a2","year":2020},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.525986Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:33c5497684567c31d48dcfe0ff983cfa32498364ae286ef611c3f86aa1bc21ff","observation_id":"36da0707-447f-4374-9210-3493f1a75a3a","resolution":{"observed_at":"2026-08-07T14:18:12.675839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.399620Z","title":"Visual question answering based on local-scene-aware referring expression gener- ation,","venue":null,"work_id":"d7a07d72-eb56-4c36-8749-42d727f2e5f5","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.638953Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:3f8c9f81bef5f80d0b5fd1bd0c2cd8d0172dfd65822bc06f2be56a8eb87df689","observation_id":"3aae7709-bd4b-4b7c-ab37-489f55800d69","resolution":{"observed_at":"2026-08-07T14:18:12.453001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03136","last_updated":"2020-09-17T10:06:25Z","snapshot_observed_at":"2026-08-07T03:37:57.269526Z","submitted_at":"2020-04-07T05:44:58Z","title":"g2pM: A Neural Grapheme-to-Phoneme Conversion Package for Mandarin Chinese Based on a New Open Benchmark Dataset","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03136","snapshot_observed_at":"2026-08-07T14:18:05.745845Z","title":"g2pm: A neu- ral grapheme-to-phoneme conversion package for man- darin chinese based on a new open benchmark dataset,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.745845Z"},"links":{"cited_paper":"/paper/2004.03136","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:4b673ad51190249214e2f4af7691f74cfa9d7b24728ffcd6fcf6c852c844458b","observation_id":"8c4e8ad5-65b6-4d70-a95b-da301167af8a","resolution":{"observed_at":"2026-08-07T14:18:05.745845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.228745Z","title":"Good neighbors are all you need for chinese grapheme-to-phoneme conversion,","venue":null,"work_id":"976930ff-bd36-4726-8cd9-fe33a57beeff","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.901227Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:97dd88bec4aa23cb6fc45ecaf4b9932aebf1c439ee999c3791663b44722cb0b4","observation_id":"30dadbdd-6bc3-4364-aa19-70120f4a80cb","resolution":{"observed_at":"2026-08-07T14:18:12.301738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.00196","last_updated":"2015-08-20T06:27:07Z","snapshot_observed_at":"2026-07-06T04:19:25.720017Z","submitted_at":"2015-05-31T05:14:06Z","title":"Sequence-to-Sequence Neural Net Models for Grapheme-to-Phoneme Conversion","version":3},"cited_work":{"arxiv_id":"1506.00196","doi":null,"metadata_source":"pith","pith_arxiv_id":"1506.00196","snapshot_observed_at":"2026-08-07T14:18:09.057356Z","title":"Sequence-to-Sequence Neural Net Models for Grapheme-to-Phoneme Conversion","venue":"cs.CL","work_id":"f62137cc-beec-4d3f-9c7a-3fbea2b6a32e","year":2015},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.067791Z"},"links":{"cited_paper":"/paper/1506.00196","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:a231874ae07b7afb786cc7e2c4e9946c17ec1f39124a5c05e3fd13b77e5e0450","observation_id":"b0bbd1b1-3613-4a44-9664-01eb2e105991","resolution":{"observed_at":"2026-08-07T14:18:09.167416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.058572Z","title":"A style- based generator architecture for generative adversarial networks,","venue":null,"work_id":"8c02d47d-21de-45fc-9fa8-15f4054c21a1","year":2019},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.180402Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:b35666064956db44cf01b09e21ae880fe9c7c803161f1a5ba7ef5ed68ca9b3a7","observation_id":"d82d0f7e-c53e-475f-a0dc-ee70dc5c716a","resolution":{"observed_at":"2026-08-07T14:18:12.119038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.859919Z","title":"Pvae-tts: adaptive text-to-speech via pro- gressive style adaptation,","venue":null,"work_id":"bc81e103-39c4-4065-b9d3-3ee09dfda28e","year":2022},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.339347Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:e6ebaf7f3184d31641e884b1574330fbf975b5b423a371d0c4950da1b97fbdfd","observation_id":"a1b82218-d836-4112-820e-8a4f228499f4","resolution":{"observed_at":"2026-08-07T14:18:11.947344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16171","last_updated":"2023-07-30T08:49:55Z","snapshot_observed_at":"2026-07-06T16:00:16.896971Z","submitted_at":"2023-07-30T08:49:55Z","title":"HierVST: Hierarchical Adaptive Zero-shot Voice Style Transfer","version":1},"cited_work":{"arxiv_id":"2307.16171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16171","snapshot_observed_at":"2026-08-07T14:18:08.869751Z","title":"HierVST: Hierarchical Adaptive Zero-shot Voice Style Transfer","venue":"cs.SD","work_id":"68112dcd-b6a2-47f2-be28-63f64ab7a2a8","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.503844Z"},"links":{"cited_paper":"/paper/2307.16171","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:c92dba41b43b61be4dc30220d05e4c3d00ee898f36c29ef05c75b7b25784ad83","observation_id":"42cf2d74-98d2-4917-965f-8d404a0df081","resolution":{"observed_at":"2026-08-07T14:18:08.945303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.696018Z","title":"Zero-shot multi-speaker text-to-speech with state- of-the-art neural speaker embeddings,","venue":null,"work_id":"b288bdc7-e0c3-458b-b8de-a29f0274b6dd","year":2020},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.629135Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:9eca33f141810f66e019e0fed87bd3a982129c39a38f309e3d13b360de9fd06d","observation_id":"4a0980d2-27ee-49d7-b599-0b4d3cb8b083","resolution":{"observed_at":"2026-08-07T14:18:11.775777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.589407Z","title":"Style tokens: Unsuper- vised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"cf65e988-a919-4d00-8046-297b39df1cf8","year":2018},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.760988Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:7bed72706f6b98e4baadd7e90d627843ea376642aa221dbc9a0ed8677cb2962b","observation_id":"79c19d01-3b34-4e62-b915-fe224c8525be","resolution":{"observed_at":"2026-08-07T14:18:11.631621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.433220Z","title":"Tdnn: a two-stage deep neural network for prompt-independent automated essay scoring,","venue":null,"work_id":"845c7351-95a1-4330-b4ed-ebdd05f125ab","year":2018},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.856266Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:c57db3f94aebda095d13688395a15234c8663ff9847a0de5c295a05c7434c71e","observation_id":"d0b06a71-5979-4936-8527-1d03e1f09161","resolution":{"observed_at":"2026-08-07T14:18:11.515566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.286003Z","title":"Information sieve: Content leakage reduction in end-to-end prosody transfer for expressive speech synthesis.,","venue":null,"work_id":"841e6ac1-89f9-4e5a-ad85-5d496417799b","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.947126Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:34cae3426b719c5c0a3b6feaec0ae522a986e60c2d096b9a4978b2dda4032480","observation_id":"9a48de4f-9606-421a-ad74-bc5d17d1e1f5","resolution":{"observed_at":"2026-08-07T14:18:11.335986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.108973Z","title":"Crossspeech: Speaker- independent acoustic representation for cross-lingual speech synthesis,","venue":null,"work_id":"092b9e46-3c3b-4b37-8a40-bd902d67700b","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.102922Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:7ed92aef06d11093be8274ee7157d4425812e247019c3a634471c6a22ddda17d","observation_id":"6f816494-1e74-415c-9a47-d20afcc00c2d","resolution":{"observed_at":"2026-08-07T14:18:11.190563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.919694Z","title":"Fastpitch: Parallel text-to-speech with pitch prediction,","venue":null,"work_id":"8606b456-e655-4ccb-b61b-f871bc29c1cd","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.200532Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:15428ce4777f1271e5ebdd0a6c3363ea83bce488e17d5a151fb4e67876ca06e8","observation_id":"dc9dc158-6d42-4f83-9613-bf7fb5405cc5","resolution":{"observed_at":"2026-08-07T14:18:11.001014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.755846Z","title":"One tts align- ment to rule them all,","venue":null,"work_id":"060fd0a9-3fef-4817-abf3-cfa0ec0a0e46","year":2022},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.326279Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:ae3dcdafd90932d2fe9ce9f9ec102c5354af8a11baecf1068cc23fd72c0a37e9","observation_id":"5f361644-17e6-46f0-a218-9ad3bd3cc1cf","resolution":{"observed_at":"2026-08-07T14:18:10.818672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.568086Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"99986da0-3c5a-4829-aca5-5d8cbd8601fb","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.421867Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:493ecaaa0b8ab55c952ffeddd9b38bb60d9fd2fd86a9e55aa0d7bb353bc2ad21","observation_id":"511571fd-7c12-4c64-8f79-a7ee29f2190a","resolution":{"observed_at":"2026-08-07T14:18:10.651076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13921","last_updated":"2024-01-25T03:37:23Z","snapshot_observed_at":"2026-07-06T17:20:11.913242Z","submitted_at":"2024-01-25T03:37:23Z","title":"Intelli-Z: Toward Intelligible Zero-Shot TTS","version":1},"cited_work":{"arxiv_id":"2401.13921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.13921","snapshot_observed_at":"2026-08-07T14:18:08.713556Z","title":"Intelli-Z: Toward Intelligible Zero-Shot TTS","venue":"eess.AS","work_id":"ed7b1776-08cb-4ecd-a554-8f04329b9716","year":2024},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.519604Z"},"links":{"cited_paper":"/paper/2401.13921","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:3480728443559820fe4533d7c7a9b30225caa43b3fbf513486ca5ecbdf0b4775","observation_id":"abfc3dad-dccb-4466-af57-5ea8cc7679f7","resolution":{"observed_at":"2026-08-07T14:18:08.762666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.385563Z","title":"Meta-stylespeech: Multi-speaker adaptive text-to-speech generation,","venue":null,"work_id":"21298278-81d1-47c7-8de3-7e7fea68bf8e","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.615320Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:6d78140cf10b2003d06cb9a4f02cdcdaf38637f5703acfe0364251106d652447","observation_id":"530febdc-55c3-44f4-912a-7c9f92ebaa57","resolution":{"observed_at":"2026-08-07T14:18:10.472055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.248606Z","title":"Language modeling with gated convolu- tional networks,","venue":null,"work_id":"b7091a67-d2e0-4417-868a-0645d14a6185","year":2017},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.680288Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:2de7c930cac72f45c40c2ab4781d3db1142bd95fb84566c1234fc765abe3a26c","observation_id":"d4b4ffc6-4bca-48a4-b1be-c0671f60026c","resolution":{"observed_at":"2026-08-07T14:18:10.306328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10077","last_updated":"2020-02-25T03:12:57Z","snapshot_observed_at":"2026-07-06T08:46:09.705605Z","submitted_at":"2019-12-20T19:49:32Z","title":"Are Transformers universal approximators of sequence-to-sequence functions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.10077","snapshot_observed_at":"2026-08-07T14:18:07.766917Z","title":"Are transformers universal approximators of sequence-to-sequence func- tions?,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.766917Z"},"links":{"cited_paper":"/paper/1912.10077","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:8241cd813a5909fcb8bbfba0a86f90f5c8aa35ab5fa2ff4de25148fd46d66506","observation_id":"908a9664-6277-4c40-80e4-df1aa557d70f","resolution":{"observed_at":"2026-08-07T14:18:07.766917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:07.866011Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.866011Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:e24f2c290c050a86bfed8748ca1535aee7dfbd18e80cb31e085fec495d8922ea","observation_id":"92165529-cd1b-4943-bb4e-605d0103a483","resolution":{"observed_at":"2026-08-07T14:18:07.866011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00993","last_updated":"2021-03-01T13:28:59Z","snapshot_observed_at":"2026-07-06T10:45:38.818760Z","submitted_at":"2021-03-01T13:28:59Z","title":"AdaSpeech: Adaptive Text to Speech for Custom Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00993","snapshot_observed_at":"2026-08-07T14:18:07.939965Z","title":"Adaspeech: Adap- tive text to speech for custom voice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.939965Z"},"links":{"cited_paper":"/paper/2103.00993","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:3e4582a797127bac0b09d31e9b7cd50487fab1bc640c98b4cb2146eb9e7c95a7","observation_id":"c469f24b-e4da-4122-ade8-17851fad0e9d","resolution":{"observed_at":"2026-08-07T14:18:07.939965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T14:18:08.017944Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.017944Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:b0ece746ea15156f1c8514d4ed9c35283f16e26751ceeeb5f1cbbca4897fd101","observation_id":"e2d9866a-37a3-49c7-8e15-4baa6a3afb64","resolution":{"observed_at":"2026-08-07T14:18:08.017944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-07-06T15:35:15.564727Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-07T14:18:08.101378Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.101378Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:4927a6e6f381e51a5f1bdf6e90120c96e0ae5edc13e303b4c463d64da3558c3c","observation_id":"083a2173-1554-4c3a-90aa-8c2f0ab27e0a","resolution":{"observed_at":"2026-08-07T14:18:08.101378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.042278Z","title":"Superseded-cstr vctk corpus: English multi- speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"2745ce4b-b282-490e-b939-0bb0f78004fe","year":2016},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.199025Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:05b99b8a343dbf2329a7c74a1158416c249115527719e3751c6edb9577c92e97","observation_id":"4e2af530-5dc2-40a6-a0ab-88ff40be5f0e","resolution":{"observed_at":"2026-08-07T14:18:10.122255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:09.877215Z","title":"Real-time voice cloning,","venue":null,"work_id":"49ec09a1-e071-432b-92b5-514bdeeec4db","year":2019},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.286530Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:06335ee213fd2bf48d3ca5de26fcd202e7ef22819d26e56b14c905e451dccfb7","observation_id":"6581b744-62a3-4261-8cce-dfe4a0615a55","resolution":{"observed_at":"2026-08-07T14:18:09.965005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:08.382649Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to-speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.382649Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:7d57719fa5ff9c12604379d00af52358096e056bc8eb8e1a2292bd514f7a992b","observation_id":"25fc11c5-65a4-45d8-9609-30220110d0d5","resolution":{"observed_at":"2026-08-07T14:18:08.382649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:09.690513Z","title":"Hifi- gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"246f94be-5af7-4edf-a810-cc1915002b15","year":2020},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.477884Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:9a5ff8383b265de315fec1153e85803973db88b8ee716e2b040be0100b86fa89","observation_id":"bcbbaf2d-5d57-4e1b-ab85-35dafb344417","resolution":{"observed_at":"2026-08-07T14:18:09.743897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:12:54.550549Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":4,"verified_fuzzy":21},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2505.19384."}