{"as_of":"2026-08-22T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:717acf37bcdce7a277c174e10c717d295fcde53646080e6a68e6bd9c5d13228d","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:25:27.963778Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:25:25.532629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T21:25:28.221289Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2507.00227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00227","snapshot_observed_at":"2026-08-06T21:25:28.221289Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","venue":"eess.AS","work_id":"c1b45746-7678-48b5-8133-e02764279dfe","year":2025},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:25.532629Z"},"links":{"cited_paper":"/paper/2507.00227","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:d4d7b853acc144e242315696740d1698c68cc8911fd765d5748554c2d71db200","observation_id":"62ae4ed7-aadc-4108-929e-47e32adb34e9","resolution":{"observed_at":"2026-08-06T21:25:28.226575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00227","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2507.00227","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:5de14dd7c0897fd5fc2609fe6989bb12ad20e8120fe60c3b37c64e03dfc5aa11","observation_id":"f5e865ca-1348-4678-84c3-c0977397f6ec","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00227/citation-record","integrity":"/paper/2507.00227/integrity","json":"/paper/2507.00227/citation-record.json","paper":"/paper/2507.00227"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2507.00227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00227","snapshot_observed_at":"2026-08-06T21:25:28.221289Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","venue":"eess.AS","work_id":"c1b45746-7678-48b5-8133-e02764279dfe","year":2025},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:25.532629Z"},"links":{"cited_paper":"/paper/2507.00227","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:d4d7b853acc144e242315696740d1698c68cc8911fd765d5748554c2d71db200","observation_id":"62ae4ed7-aadc-4108-929e-47e32adb34e9","resolution":{"observed_at":"2026-08-06T21:25:28.226575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.739902Z","title":"Overall Pipeline The pipeline follows the architecture of ToucanTTS [22,23] due to its modularity and open-source implementation","venue":null,"work_id":"103eb96d-6ad0-4127-a0ce-c3faefb8a52e","year":null},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:25.656559Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:2725b86ea77a7b1839e381b4948dca61bbc6c36de731f91f183d1eb5862fa802","observation_id":"49afb146-51f8-45db-b45b-9e62d7e0db1f","resolution":{"observed_at":"2026-08-06T21:25:28.745430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.726521Z","title":"Datasets Training Data: For this work, we constrain ourselves to read speech, leaving experiments on conversational speech and other more challenging scenarios for future work","venue":null,"work_id":"285eafce-b9d4-483b-a3f8-156143bf79bd","year":null},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:25.862464Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:5000ac9dc7fc180681755f4bb80fa2d8b6c73e67059cc89c1fe5308153867b5f","observation_id":"9f358991-7879-422c-88a6-e17c4e762c14","resolution":{"observed_at":"2026-08-06T21:25:28.731134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.684820Z","title":null,"venue":null,"work_id":"ceb9ad11-4ff4-4e38-8da2-b0b0a1460e48","year":null},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.280545Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:de58c22effdd6069d1a57bd70e966c71785eb79cea7a7cc8c12bc41aa888a283","observation_id":"36a8c919-1b5c-4d38-85a9-b55fc6f53735","resolution":{"observed_at":"2026-08-06T21:25:28.689811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-20T12:18:44.930688Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T21:25:26.849481Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.849481Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:685db62e4324de938368eb09871cb9c3b633a9293abd7d7030933e3e89164fdc","observation_id":"efa6ef73-0ed5-4a80-8573-fa8b4f8c2b25","resolution":{"observed_at":"2026-08-06T21:25:26.849481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T21:25:26.955694Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.955694Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:6f10bde57b8c04c6e56857ee4e4f57d1b0ee584913d55c3d4d8164f561cd9f64","observation_id":"1e3d7a7a-6229-458b-aee6-151703c289b9","resolution":{"observed_at":"2026-08-06T21:25:26.955694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.671282Z","title":"Naturalspeech: End-to-end text-to- speech synthesis with human-level quality,","venue":null,"work_id":"5c8f1480-e39a-462c-9a70-48c5d2ac4324","year":2024},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.420220Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:cd3e137326a2f038091f679cb050c703c1a799f9bff949a33e354119d1342eef","observation_id":"60e604e7-d9d6-4595-b079-2b58e419f91e","resolution":{"observed_at":"2026-08-06T21:25:28.675887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.699196Z","title":"The models were trained for 100k steps with a batch size of 32, which allowed all models to converge","venue":null,"work_id":"2d572d16-6b20-4dc1-bd65-8b7afda1fbcd","year":null},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.173463Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:e58159ca0e929c9d05464400a00b305a34542d0f28b3a89daa5da4b38bc5a0ff","observation_id":"7bf20346-5421-4bb7-b7dc-288481467bc3","resolution":{"observed_at":"2026-08-06T21:25:28.703934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04646","last_updated":"2022-07-11T06:15:45Z","snapshot_observed_at":"2026-08-16T16:47:01.203717Z","submitted_at":"2022-07-11T06:15:45Z","title":"DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04646","snapshot_observed_at":"2026-08-06T21:25:26.524942Z","title":"DelightfulTTS 2: End-to-end speech synthesis with adversarial vector-quantized auto-encoders,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.524942Z"},"links":{"cited_paper":"/paper/2207.04646","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:353a0a29133f16654705da585687b6585eb5b7b3f035d10ffb422c7506bc481a","observation_id":"82a9bb4d-1a27-4e73-8901-e1fab26881cb","resolution":{"observed_at":"2026-08-06T21:25:26.524942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.656142Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers,","venue":null,"work_id":"cb676697-0e0e-4705-8b16-55c0a4c4438d","year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.605546Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:343651d05cefbc0392abdf87b8544cfbfe94798dd4b8328604e2c63e27b70d5c","observation_id":"584a3be3-77cc-4d51-9898-a16971698376","resolution":{"observed_at":"2026-08-06T21:25:28.661489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.640591Z","title":"DelightfulTTS: The Microsoft Speech Synthesis System for Blizzard Challenge 2021,","venue":null,"work_id":"6d4dff10-fe47-4614-a211-003fd4109f8c","year":2021},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.735271Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:280c6baa8cb0109d6534a81b99631fa123997ae73084fbdc3c8e8f951149a654","observation_id":"60025069-ceb7-4c55-a07a-21a884d9afff","resolution":{"observed_at":"2026-08-06T21:25:28.645387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.581686Z","title":"FastSpeech: fast, robust and controllable text to speech,","venue":null,"work_id":"09f426b5-0722-42c7-b5c9-1317f776625d","year":2019},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.752307Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:c08f35a81c429c7ef096b36b0a5c410b328827ff31c10c4cbfe51dd6997822ce","observation_id":"557055bb-dfe4-4e1c-afb2-f67bedb5357e","resolution":{"observed_at":"2026-08-06T21:25:28.586496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.626381Z","title":"A vector quantized approach for text to speech synthesis on real-world spontaneous speech,","venue":null,"work_id":"6c3768ea-13a6-4550-8f20-e8d524d1c2ae","year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.118271Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:fed36aeb464c1018e085cda2fe93c5ff21512656ecbd9af3679e808fdefb7acb","observation_id":"c5f6263b-378c-4b2b-8d67-c6a74ca4b328","resolution":{"observed_at":"2026-08-06T21:25:28.630807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.611723Z","title":"Prosody Is Not Identity: A Speaker Anonymization Approach Using Prosody Cloning,","venue":null,"work_id":"4342af78-b3be-446d-8041-14f9d793ca92","year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.288319Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:7ea9fc711f177d2972c63fd2a50bbcc62f8613f456ee072ef9a6c79687fa4956","observation_id":"12e1a565-b37b-4476-95f3-ed08d75bc41c","resolution":{"observed_at":"2026-08-06T21:25:28.616984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.596437Z","title":"PoeticTTS - Control- lable Poetry Reading for Literary Studies,","venue":null,"work_id":"5553c9bc-d89f-41e0-a15f-5ae4bd812b43","year":2022},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.408280Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:376d8ca45b751e5adb8897a3fdf1555ae5cc5c23e4397f1f2eb6fd013534fbc3","observation_id":"3606ef3f-76b6-416d-a74c-7b655f6b3dc1","resolution":{"observed_at":"2026-08-06T21:25:28.601907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08857","last_updated":"2025-04-24T22:48:39Z","snapshot_observed_at":"2026-08-20T20:24:21.747243Z","submitted_at":"2025-02-13T00:15:54Z","title":"ASVspoof 5: Design, Collection and Validation of Resources for Spoofing, Deepfake, and Adversarial Attack Detection Using Crowdsourced Speech","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08857","snapshot_observed_at":"2026-08-06T21:25:27.511513Z","title":"Asvspoof 5: Design, collection and validation of resources for spoofing, deepfake, and adversarial attack detection using crowdsourced speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.511513Z"},"links":{"cited_paper":"/paper/2502.08857","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:53ac1afbbb90b81a3bb88597e199e3068881c91ff1ee9969070a71d8775e6651","observation_id":"8f0e7379-065e-4a69-be68-17a0be58255e","resolution":{"observed_at":"2026-08-06T21:25:27.511513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06602","last_updated":"2025-08-25T07:30:54Z","snapshot_observed_at":"2026-08-11T19:26:50.636660Z","submitted_at":"2024-12-09T15:50:25Z","title":"Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06602","snapshot_observed_at":"2026-08-06T21:25:27.548842Z","title":"Towards controllable speech synthesis in the era of large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.548842Z"},"links":{"cited_paper":"/paper/2412.06602","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:8b35fcf73c3ec3ceb8dde7537e459f6c285249ad4065b3b927c74a4fcaa41f5a","observation_id":"49542191-d96c-4e3d-b266-6d82137c50fe","resolution":{"observed_at":"2026-08-06T21:25:27.548842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.482757Z","title":"Rectified flow: A marginal preserving approach to opti- mal transport,","venue":null,"work_id":"e64304e4-73d6-4c15-ac6a-fd8773fe3a1a","year":2022},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.886384Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:488291ef1d29ae287d67317a28341910c17d9772ae5f73ce2189a5feba68ebd3","observation_id":"e802ac51-b664-4305-b18a-33aac17ab649","resolution":{"observed_at":"2026-08-06T21:25:28.488634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.566116Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech,","venue":null,"work_id":"e3a079d2-7cd7-4d98-8c89-076b02754b69","year":2020},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.806869Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:abe75da09bf42a6fa0cfc314800295d240e8e8d9b6fc2041446f0cb221116d99","observation_id":"242c652e-5f93-4d53-9255-93f37d509e64","resolution":{"observed_at":"2026-08-06T21:25:28.571517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.550006Z","title":"FastPitch: Parallel text-to-speech with pitch pre- diction,","venue":null,"work_id":"302df73a-4289-4262-ad37-e521638eaaa9","year":2021},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.813095Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:ed2873b85979eb5d8b24f1fda8a7c9349bcb35ac3fbac0e627956dae1b841fe7","observation_id":"6e20df70-d04a-48c3-85fd-ea2f07fb9a7c","resolution":{"observed_at":"2026-08-06T21:25:28.554875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.532939Z","title":"Variational inference with normal- izing flows,","venue":null,"work_id":"dc06078f-386d-4abb-b531-ba1741863082","year":2015},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.874143Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:3ed278e817ce3959210f2e21cd80b1696ac8249572ad7ee01d6dcc9c0dfe0dc4","observation_id":"f9a864fb-5f9b-4004-9df1-bafdeb42aba1","resolution":{"observed_at":"2026-08-06T21:25:28.538360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.517187Z","title":"Flow Matching for Generative Modeling,","venue":null,"work_id":"0a4597eb-8ddc-4794-b414-1bf4c2031e1c","year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.878441Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:51f8740d37c3836f5a503526d2ef1055dec9681fa788032bab3e22f19da9a9dd","observation_id":"2090e922-1f97-4c9f-bc2e-b63a297f009c","resolution":{"observed_at":"2026-08-06T21:25:28.522146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.500316Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow,","venue":null,"work_id":"710c6511-3614-4c72-8cd5-95ba423937f7","year":2022},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.882247Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:e992daac3f62c3f85f139749c6c770e5801e67edd40bcefcc7f895fa3310ee13","observation_id":"779bf251-b542-40dd-843b-4d7e562ca3ab","resolution":{"observed_at":"2026-08-06T21:25:28.505410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.404552Z","title":"Language-Agnostic Meta-Learning for Low-Resource Text-to-Speech with Articulatory Features,","venue":null,"work_id":"b17cdbd6-b5c8-43b8-beeb-bd836ea19156","year":2022},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.911793Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:b861a5bad948d13e77cc19cce2727cb48f4af3614fdf406648e15b9c0efc0426","observation_id":"59365757-9d0b-446c-8ee0-cca33bebc2d8","resolution":{"observed_at":"2026-08-06T21:25:28.409741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:27.891296Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.891296Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:3945834e7016a7be8a6ba02e8fef75fd6b3c04a7475fee3c563a5ca5460c6bb8","observation_id":"8f081286-6e61-4b29-bef8-b04928499a20","resolution":{"observed_at":"2026-08-06T21:25:27.891296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.454591Z","title":"Varianceflow: High-quality and controllable text-to-speech using variance information via nor- malizing flow,","venue":null,"work_id":"37f35b31-6a61-4faa-a96b-219d33e6a238","year":2022},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.895236Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:0c5c363083b3a6a0cd8cecdeee91c98163ea51a8e580e6919a1cf9131e51c0cb","observation_id":"0cb83357-74db-4dc2-b2bf-27db27d741ad","resolution":{"observed_at":"2026-08-06T21:25:28.459704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05401","last_updated":"2024-06-08T08:49:22Z","snapshot_observed_at":"2026-08-16T13:44:57.145058Z","submitted_at":"2024-06-08T08:49:22Z","title":"Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech","version":1},"cited_work":{"arxiv_id":"2406.05401","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05401","snapshot_observed_at":"2026-08-06T21:25:28.014860Z","title":"Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech","venue":"eess.AS","work_id":"f4750fd9-e9b0-4a93-9a0e-b32f548a8fc9","year":2024},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.899184Z"},"links":{"cited_paper":"/paper/2406.05401","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:036db3d414d666ee00b9c72d3b949cda0e72c8b2f7f8c9993af522ffc8ab423b","observation_id":"3e3a62d0-6f2a-47c5-a44b-15eb5ad24685","resolution":{"observed_at":"2026-08-06T21:25:28.021971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.438068Z","title":"The IMS Toucan system for the Blizzard Challenge 2023,","venue":null,"work_id":"724da1a5-0094-4325-9c81-d4d79ebd55b1","year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.903332Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:3581d65d65323f01c2285bdca5c6cf84cbe5f7c2cdbc9bf4eac8508d77e420d7","observation_id":"048829ea-3db1-4189-b01e-022b9e6e6f6e","resolution":{"observed_at":"2026-08-06T21:25:28.444819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.419966Z","title":"Meta Learning Text-to-Speech Synthesis in over 7000 Languages,","venue":null,"work_id":"63d42d2a-4005-4d5c-aed0-277354758a9f","year":2024},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.907757Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:fe917b4e7c46c513b1e41d1a2957d4154a3207c815255f9790541b08a0f98d4a","observation_id":"45cbab1c-4d07-4b45-a091-589cf8fafecc","resolution":{"observed_at":"2026-08-06T21:25:28.426081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.712914Z","title":"This dataset is com- prised exclusively of read speech in English and features 2,456 speakers","venue":null,"work_id":"0b6b40b0-80f2-4695-bdc7-581246abf860","year":null},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.043093Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:2b44d1c03a3693c26cea5618f3f1d604acb708aad595e54c9aef31d6e20e9cfc","observation_id":"7bd51685-5e4c-4780-95e7-84e69a297bd8","resolution":{"observed_at":"2026-08-06T21:25:28.717629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.389821Z","title":"Con- former: Convolution-augmented Transformer for Speech Recog- nition,","venue":null,"work_id":"7faec00a-4daf-4d55-b8f6-cf5b28cef91d","year":2020},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.915791Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:847ce01739dbcf0da39b143bbf9b2f69326d63b2281f901093cf706bde24e49b","observation_id":"db497eca-0ddc-452a-b11c-9af99834d4de","resolution":{"observed_at":"2026-08-06T21:25:28.394434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.375225Z","title":"Exact Prosody Cloning in Zero- Shot Multispeaker Text-to-Speech,","venue":null,"work_id":"13a8c770-049e-4b47-b762-9fc112dbdfba","year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.919719Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:891cd9db1bc5c3c3179ece3d5e73ef2ea4035c2588fd5776aa03ac0c230ccdcd","observation_id":"4b29a346-0c94-4e90-bac6-4cfa8a31275d","resolution":{"observed_at":"2026-08-06T21:25:28.380250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.359404Z","title":"ECAPA- TDNN: Emphasized Channel Attention, Propagation and Ag- gregation in TDNN Based Speaker Verification,","venue":null,"work_id":"a1d43050-b7c3-4cb4-aaf8-0a5368419aeb","year":2020},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.923496Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:f870b198b304cc34ca8ce7232b76dcbcd137579f2d13074cc4248981d63369cd","observation_id":"415de59b-ad34-4d83-8309-563006018323","resolution":{"observed_at":"2026-08-06T21:25:28.364082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-18T17:51:41.801692Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-06T21:25:27.927368Z","title":"SpeechBrain: A General-Purpose Speech Toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.927368Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:24ba73037ded09f6733a4729884d6a9632e3012ebd590903ccd5426daf0f3685","observation_id":"42d95302-b371-44ce-85d5-f76c3b45f116","resolution":{"observed_at":"2026-08-06T21:25:27.927368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.344922Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching,","venue":null,"work_id":"6ccf2701-50c1-4e3a-914d-8579b20271eb","year":2024},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.931313Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:dcd9b51e818d44d5a2acf10993018b03ed7e10f675bc590fdfa45b4908c2876e","observation_id":"353c162b-3dc2-4405-815a-4947c14847fb","resolution":{"observed_at":"2026-08-06T21:25:28.349774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.330851Z","title":"Lib- riTTS: A Corpus Derived from LibriSpeech for Text-to-Speech,","venue":null,"work_id":"fd58108d-0257-4406-8d43-c52246180115","year":2019},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.935310Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:4f5696d8ae8d3f32d1ffc1b4470d2a48e425640c48eea45b25c21c380ad78e7f","observation_id":"00f2ba9f-5f93-4624-b434-7c35ec4fd020","resolution":{"observed_at":"2026-08-06T21:25:28.335381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.316676Z","title":"The Ryerson Audio-Visual Database of Emotional Speech and Song (RA VDESS): A dy- namic, multimodal set of facial and vocal expressions in North American English,","venue":null,"work_id":"36cd294b-b866-417f-b010-8dee89bedd86","year":2018},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.939791Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:5fc1d195a63bc5f176cb3256d3fd2f15e2119566f11ad792c94e043e45e9d121","observation_id":"bf9bc176-fd1d-4dbc-9c79-ee70e4dd65c0","resolution":{"observed_at":"2026-08-06T21:25:28.321451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.300982Z","title":"ADEPT: A Dataset for Evaluating Prosody Transfer,","venue":null,"work_id":"3eebc18b-940e-47bc-bc15-9f882604769b","year":2021},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.943740Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:2e6865ca5d919d82d21efe40edf48bb4755554f4581181a8778479e8c4f05e5f","observation_id":"543afebb-e387-4652-b980-3adcf089e46d","resolution":{"observed_at":"2026-08-06T21:25:28.306765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:27.947715Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.947715Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:ec5497a180250628ec33ef5912f44a24c8dcfbb96afa11ba98a9cf02a9225d9c","observation_id":"27d9d0f8-92aa-4c9b-8c88-bac2c33b65c8","resolution":{"observed_at":"2026-08-06T21:25:27.947715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.277382Z","title":"Divergence measures based on the shannon entropy,","venue":null,"work_id":"b75cf822-88c3-4734-a996-ba7a922d05e2","year":1991},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.951475Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:3d3fe442efcc4d328f917cb97100a4739122b4b0e08ec2ef7c26f6dd17db5a44","observation_id":"99558b67-758e-4e19-b44c-682672e7fe52","resolution":{"observed_at":"2026-08-06T21:25:28.281928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:27.955443Z","title":"On information and sufficiency,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.955443Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:f207e9741d0415a46ec68a7effcb17e47ce46cec8c117188cce11aa6ab9453ef","observation_id":"dbd4f5c4-3d6a-4fc5-9a2e-3c672fec2720","resolution":{"observed_at":"2026-08-06T21:25:27.955443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.253366Z","title":"Use of ranks in one-criterion variance analysis,","venue":null,"work_id":"bc1fe9b7-afb3-4019-8061-8b34418e0a95","year":1952},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.959910Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:eb8ec7f7f06afe849c0dc581a74f22d4d3c728c00b2e6f0297d46c55c517a02f","observation_id":"b718218a-af35-42a3-9d89-517e3504650c","resolution":{"observed_at":"2026-08-06T21:25:28.257991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:25:28.237207Z","title":"Multiple comparisons using rank sums,","venue":null,"work_id":"bd92e9ac-b084-4087-8589-2ce99df9a334","year":1964},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:27.963778Z"},"links":{"citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:af6e5b7a3e9b242001e802f07e8f6f9c1b573b9058d1d1c9db7482b105d4186c","observation_id":"85f92009-20f1-448b-8b24-28193523c985","resolution":{"observed_at":"2026-08-06T21:25:28.242311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2507.00227."}