{"as_of":"2026-08-13T12:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ee3052156f5f1173adc0249b4ef04118e6f712208d46bf01b1d40af09e3606d","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:33:56.087718Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20155/citation-record","integrity":"/paper/2412.20155/integrity","json":"/paper/2412.20155/citation-record.json","paper":"/paper/2412.20155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.469743Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers,","venue":null,"work_id":"3d7c58b1-e3b0-4a07-a28f-d5c454d67145","year":2024},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.978812Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:fc1158041d525bd9e178f26c514b7a1351629f9793c18e1ca2ad0de39a6224d4","observation_id":"57b2daa0-28dc-43fe-98e5-4938d53c2b1a","resolution":{"observed_at":"2026-08-10T23:33:56.474405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-10T23:33:55.983782Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.983782Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:d5948b6b40f5826cc1241cf75487096dd6305d2c8437f5514a117910111767b9","observation_id":"3637ec4e-14db-48f5-85d7-b43f73f21954","resolution":{"observed_at":"2026-08-10T23:33:55.983782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.456323Z","title":"Grad-StyleSpeech: Any-Speaker Adaptive Text-to-Speech Synthesis with Diffusion Models,","venue":null,"work_id":"bc14eabb-0aa9-43f5-a82e-ab129eef0b34","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.989046Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:1ee541bfb936811879a392a3a5479ec9378db07d7b7d2035371ea361e5ba3272","observation_id":"ff02bd9e-0d6f-41f9-b8fb-d736d2c1e42c","resolution":{"observed_at":"2026-08-10T23:33:56.460667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-08-13T11:23:37.547715Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-10T23:33:55.993734Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.993734Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:e5bfc273a378eb8e9f033095f173a29d5138a0035ebe131a8000064ca2a81501","observation_id":"c43b41df-fc1b-4f15-99f1-05aa0107e086","resolution":{"observed_at":"2026-08-10T23:33:55.993734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.443087Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot V oice Conversion for Everyone,","venue":null,"work_id":"7779f3b4-b630-422f-b14d-544275872e30","year":2022},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.998428Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:e20a02e764424c1cfb657083de2e5c331745756cff958225f81f70aa5d1eabc0","observation_id":"cd36bbc1-d4a0-4f91-acc1-c84c63eb359c","resolution":{"observed_at":"2026-08-10T23:33:56.447310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.427858Z","title":"UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data,","venue":null,"work_id":"e77deb3f-434c-4fdb-9891-f5dcf5b88e68","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.002933Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:3e456b7892635338f9568f3f298e2f85b5d6e5867363c085d908045d39eb2d11","observation_id":"9a221940-a3e4-46a4-8058-23e060163828","resolution":{"observed_at":"2026-08-10T23:33:56.433614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.412777Z","title":"AdaSpeech: Adaptive Text to Speech for Custom V oice,","venue":null,"work_id":"8638ac96-2238-42fd-954e-9fb21aac7007","year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.008124Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:39ce7ccc3cc0e23ae50719706d7d45ab28f72f94545445e0aa852f3ce1a5433c","observation_id":"0a1b30dc-906f-4ccd-afbe-7aaf74273569","resolution":{"observed_at":"2026-08-10T23:33:56.417651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05798","last_updated":"2022-04-06T01:31:05Z","snapshot_observed_at":"2026-08-06T19:05:36.163265Z","submitted_at":"2021-10-12T07:51:25Z","title":"Adapting TTS models For New Speakers using Transfer Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05798","snapshot_observed_at":"2026-08-10T23:33:56.012265Z","title":"Adapting TTS models For New Speakers using Transfer Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.012265Z"},"links":{"cited_paper":"/paper/2110.05798","citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:b27e7df71fec8ce660c868a5bf42a6c73f5d942447bf6f40cb161ca23e9ba1a9","observation_id":"f9976d44-a8be-4a21-b6df-f90fd25a76c5","resolution":{"observed_at":"2026-08-10T23:33:56.012265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.398618Z","title":"V oxCeleb: A Large- Scale Speaker Identification Dataset,","venue":null,"work_id":"e556f38c-89ff-4447-9899-2ff18bb05df5","year":2017},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.016452Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:88000381709882fc505b65194d1025b346028d75f23618e82890c09c8ca4d347","observation_id":"a661e80a-66ec-4362-a7c0-a0b0b701b009","resolution":{"observed_at":"2026-08-10T23:33:56.403262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.384321Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text- to-Speech,","venue":null,"work_id":"9cca3b7a-c30b-4eba-8951-fd5d1e95dbec","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.020445Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:6c3c13749999938a1fd4f25fb67d350f264e32aae2d9b8dbfd08628ca6f6e0ce","observation_id":"38d93117-beb9-485e-989d-916afa95857c","resolution":{"observed_at":"2026-08-10T23:33:56.388986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.369265Z","title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject- Driven Generation,","venue":null,"work_id":"800db22d-40fa-4bc3-bf3b-e5b11313b798","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.024609Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:30bc0b37c8aa888c0a4618bf72566469dfbe614ba761bc2fc2080cd49273402e","observation_id":"f1afb0c0-87dc-453c-938c-e8943250de66","resolution":{"observed_at":"2026-08-10T23:33:56.374096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.353638Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech,","venue":null,"work_id":"d6cbec35-cf9d-40e4-9ff7-eb77b1271b8b","year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.028861Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:d062d521fd6b704e712f740c93a8cc8d6e9ad604187e10f0c23cd0290eac16e3","observation_id":"fe16b6a9-17dc-432b-b4b2-35952806d569","resolution":{"observed_at":"2026-08-10T23:33:56.358891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.337387Z","title":"Fast- Speech: Fast, Robust and Controllable Text to Speech,","venue":null,"work_id":"1aaaf1c7-6c2a-4f40-b2cb-b63124fa5011","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.033429Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:8c308fdc180848aa12dbfc9314f01cbb76b27d284a765ff9d7108a556556b7a9","observation_id":"9382b176-b8b7-4f09-88c6-f410b7890aaf","resolution":{"observed_at":"2026-08-10T23:33:56.342524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.322276Z","title":"One TTS alignment to rule them all,","venue":null,"work_id":"4c7426d7-d605-49d9-91ff-50e703ecc9a2","year":2022},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.038207Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:1ea2d058d73e993b2fc3ca59b7622c1e96b68d0285e88557949dfab855c7c554","observation_id":"f0ef5ba8-ea54-4ef7-a2e0-17783fb8252f","resolution":{"observed_at":"2026-08-10T23:33:56.326971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.307316Z","title":"Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation,","venue":null,"work_id":"78c5f512-ae3e-4ddc-ba71-ae3c619773c2","year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.042644Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:7399adbf0b250c52204556bef447778733fde883f9b19d31dc2a6df5d174ae24","observation_id":"d9078847-cc98-4bba-a151-30d4a22038c3","resolution":{"observed_at":"2026-08-10T23:33:56.312197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.293213Z","title":"Neural Discrete Representation Learning,","venue":null,"work_id":"1c056fe1-6067-4335-a9fe-ef7a59ef7386","year":2017},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.047331Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:708af9515803628a4464c5efd1ad69c4452507bab2695249312201c672a67f61","observation_id":"4eba0b97-1f60-431f-bbfd-390c5b60ad1c","resolution":{"observed_at":"2026-08-10T23:33:56.297286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.279435Z","title":"Denoising Diffusion Probabilistic Models,","venue":null,"work_id":"f6f39b11-bd29-435e-8423-5a4c1f259515","year":2020},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.051721Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:1828e3d05382d3f996c6e9b67d9bd9be6d07b217e41e4a56d7ce6d925c54d0c1","observation_id":"29d51dbf-2c53-450c-8a62-205117f9797d","resolution":{"observed_at":"2026-08-10T23:33:56.283889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.056337Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.056337Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:f1b9866e5a1dfe3852d791a20ac491f1ed6fdfc826dc4df4865ca4c572b11a25","observation_id":"1ec483cc-4d90-4046-adfc-852af9108672","resolution":{"observed_at":"2026-08-10T23:33:56.056337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.256235Z","title":"ProsoSpeech: Enhancing Prosody With Quantized Vector Pre-training in Text-to-Speech,","venue":null,"work_id":"d2fa6bb5-2c50-4a2f-94b0-612a7cf311a1","year":2022},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.060818Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:defe81a7a2156db9404425aeea755bfb3412d92c6fd0c68b584a5ecd79c80e49","observation_id":"0e7e9042-33f4-4d02-baf8-6208fb0c8a6d","resolution":{"observed_at":"2026-08-10T23:33:56.260513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.240526Z","title":"Language Models are Unsupervised Multitask Learners,","venue":null,"work_id":"25d2ba4e-700c-401f-af9e-96315d37a69a","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.065141Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:3cc0484efeceef2e99155ab0529267c04718e28c9da8ce75d260b50e3284577a","observation_id":"23d7844a-e2f6-4d83-9fef-2ed788c1df22","resolution":{"observed_at":"2026-08-10T23:33:56.245730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.224730Z","title":"CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit (version 0.92),","venue":null,"work_id":"05356a47-948c-41db-9e9b-7c1574517e55","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.069431Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:4d9028714e25fd62326329c0ea2587cf0b261b48392b9c3c6382d866d0b2dc2b","observation_id":"d3453a05-c41e-48a2-9416-c4e4e36264bd","resolution":{"observed_at":"2026-08-10T23:33:56.229694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.209953Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus,","venue":null,"work_id":"89ba4603-e33d-4930-a4dc-f7cc4df101cf","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.074175Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:1b313002fbf5c3da1ca5fede638db366ee940e2c7c507935877bc95ea9540423","observation_id":"18f8a39d-d911-4600-8832-ba1880980335","resolution":{"observed_at":"2026-08-10T23:33:56.214818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.194790Z","title":"Robust Speech Recognition via Large-Scale Weak Su- pervision,","venue":null,"work_id":"2d731812-86a2-446e-b737-328808ac15d2","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.078711Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:1cbe83a7c466bf8a2c809af092b223a7df13781e7b5dfea5dbfd2441192c4646","observation_id":"5eb6ee85-955e-4622-9db4-a63d68472191","resolution":{"observed_at":"2026-08-10T23:33:56.199648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.179409Z","title":"Resemblyzer,","venue":null,"work_id":"4689c788-f69c-4f69-aee0-71587f88bf01","year":2020},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.083238Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:95e36f2fe070763b1dc95118e3f11ce81413c71df807610012ad71e3dcc5770a","observation_id":"d7fb2b4b-2b90-4e08-b1f8-223f6ea86706","resolution":{"observed_at":"2026-08-10T23:33:56.184094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.162321Z","title":"HiFi-GAN: Generative Adversarial Net- works for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"9e4909b9-7b52-4450-ba6b-8cd8e826cd00","year":2020},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.087718Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:dfd14c21cb95ca82ccd944a16bcddde81f1a96a8072b2f995a09b0c26a666a36","observation_id":"865c6e60-bb0b-43e5-85db-273d0e64fde6","resolution":{"observed_at":"2026-08-10T23:33:56.168979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T02:10:04.561260Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2412.20155."}