{"as_of":"2026-08-09T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b742dc23440b3e00fc41bc1c4b72bbdc9ac8f83401db3fff6502ecac4caf4892","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:27:55.344163Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08319/citation-record","integrity":"/paper/2507.08319/integrity","json":"/paper/2507.08319/citation-record.json","paper":"/paper/2507.08319"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:28:00.222104Z","title":"Natural TTS synthesis by conditioning WaveNet on mel spectrogram predictions,","venue":null,"work_id":"d6e3bb07-e76c-475c-9af4-b52301b10cdb","year":2018},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.174809Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:4b747747277a8c2c9ae60199f895e31fed9cb523c8a025cf932904c905fefcd1","observation_id":"118ce986-8683-4f67-b85c-914848249615","resolution":{"observed_at":"2026-08-06T18:28:00.303298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:28:00.085279Z","title":"A vector quantized ap- proach for text to speech synthesis on real-world spontaneous speech,","venue":null,"work_id":"4277243c-b361-49b4-9d8c-60de4549a74e","year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.234976Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:2289f276a35d40bde8c43ebe06774bd6dbf35c94864a47a16e7e2ee3b629f427","observation_id":"076116c5-7b12-45cd-a9e9-c86b396fee5d","resolution":{"observed_at":"2026-08-06T18:28:00.139910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T18:27:53.306898Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.306898Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:f8d3e73403e7ef237285a8fc42a879ff75567f7ad9af0ef327eba185e2c70f25","observation_id":"0ba30967-01a3-484a-aed5-4987af5df8b6","resolution":{"observed_at":"2026-08-06T18:27:53.306898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-08-07T12:14:00.547338Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-08-06T18:27:53.371201Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.371201Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:5c78220214f647cfaaee40df622ec4620a9e2c96776feaad3acaa40b2c00a62d","observation_id":"4cce857c-0983-464f-aa9b-bf3fb64b0bad","resolution":{"observed_at":"2026-08-06T18:27:53.371201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06248","last_updated":"2019-08-17T06:04:46Z","snapshot_observed_at":"2026-08-04T18:00:26.763973Z","submitted_at":"2019-08-17T06:04:46Z","title":"JVS corpus: free Japanese multi-speaker voice corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06248","snapshot_observed_at":"2026-08-06T18:27:53.408284Z","title":"JVS corpus: free Japanese multi-speaker voice corpus,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.408284Z"},"links":{"cited_paper":"/paper/1908.06248","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:cfcabf9f193d35ddba76f1a777c1ae9388fe719d8b063acb9140b786f7809367","observation_id":"a7e6c808-0da9-4274-8872-508aabc41bba","resolution":{"observed_at":"2026-08-06T18:27:53.408284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.918147Z","title":"SaSLaW: Dialogue speech corpus with audio-visual egocentric information toward environment-adaptive dialogue speech synthesis,","venue":null,"work_id":"d8ddd145-eb20-44c9-9ce0-338257c9c724","year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.484224Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:ac5707aa1ba0c93b76efd3a2cefa541b54e18e25ee45512908e3ee84c835a3d6","observation_id":"36f5aa05-faf8-4f27-aaf1-02f64daaba7e","resolution":{"observed_at":"2026-08-06T18:28:00.001626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.741424Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text- to-Speech,","venue":null,"work_id":"d095b9ff-cc4f-43e2-bd61-7639bb942bd6","year":2019},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.556671Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:01b454ba0abf56b7b2de0a584ba09fb81333b93262bc73686af2213929cea739","observation_id":"9c5e6160-1e19-4dc4-bd19-5887920dc80a","resolution":{"observed_at":"2026-08-06T18:27:59.830933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.602175Z","title":"HUI-Audio-Corpus-German: A high quality TTS dataset,","venue":null,"work_id":"cfdc5d9b-8982-482c-8018-cd0217c2e9b1","year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.639708Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:bf8543ac74b74d7eeb001466886449542040658704ef2a062193e48b99c6a3ce","observation_id":"6c7597bb-db5c-49e4-abab-d249df0b0910","resolution":{"observed_at":"2026-08-06T18:27:59.654498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.411200Z","title":"Text-to-speech synthesis from dark data with evaluation-in-the-loop data selection,","venue":null,"work_id":"628193f8-5aa1-48c0-91ec-9a626d1aabc3","year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.707559Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:b631f06f7f9d73f97c27f666a45ec344ce749e4aa3f30ef347a0d4b94d7f85ed","observation_id":"62f70b8d-8166-4ea9-ab05-5e6223c11989","resolution":{"observed_at":"2026-08-06T18:27:59.459773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-07T15:49:16.814852Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T18:27:53.805528Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.805528Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:c098df2cc868e18df84a435bf1967577c69d40b5043bc1e4f49563e47694f180","observation_id":"3da493c0-b1b5-47cc-afeb-a8ec8a9fa604","resolution":{"observed_at":"2026-08-06T18:27:53.805528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09323","last_updated":"2021-12-17T05:09:44Z","snapshot_observed_at":"2026-07-06T12:19:51.150913Z","submitted_at":"2021-12-17T05:09:44Z","title":"JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification","version":1},"cited_work":{"arxiv_id":"2112.09323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09323","snapshot_observed_at":"2026-08-06T18:27:55.914601Z","title":"JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification","venue":"cs.SD","work_id":"d25a853e-6f6f-4282-a99e-0ef959d08cff","year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.881428Z"},"links":{"cited_paper":"/paper/2112.09323","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:af05b41426a0e021aee0471a3b7ba2726fda9b1fcaf1f22a2a80c893c7abed17","observation_id":"7914dd03-a75c-4d5e-8f23-4166ece8c479","resolution":{"observed_at":"2026-08-06T18:27:56.070227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.15828","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:55.659762Z","title":"J-CHAT: Japanese large-scale spoken dialogue corpus for spoken dialogue language modeling,","venue":null,"work_id":"c7293b45-e47b-42ae-91a1-0ab9eb6cedbc","year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.985871Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:d0a8dd4660de0ba712876b228e9e68f11891a38ad4047e4ee2a5bd3fbb54099f","observation_id":"6b85a835-d610-44f8-988e-a93350e38124","resolution":{"observed_at":"2026-08-06T18:27:55.798236Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.217034Z","title":"Diversity-based core-set selection for text-to-speech with linguistic and acoustic fea- tures,","venue":null,"work_id":"5b812bc9-fd3b-4262-b427-fce3f4f8099f","year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.094640Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:d7ff36d734867c91bb8a68e15aa9607d1602f9c088fb70e9d90a3c01bdfb4564","observation_id":"d69bf310-070b-4da3-860b-9a5ff3263a86","resolution":{"observed_at":"2026-08-06T18:27:59.307447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.980204Z","title":"Deepcore: A comprehensive library for coreset selection in deep learning,","venue":null,"work_id":"7b8163c8-9b7e-4b51-b11b-88383ec53226","year":2022},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.212422Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:8f70d9e0e7fbdcd80d470d83b624100216b1261909edb90762548ce2fa8c10c2","observation_id":"3c4dc365-f55d-43d8-a1ee-2ef8d31ac6dd","resolution":{"observed_at":"2026-08-06T18:27:59.104527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.807963Z","title":"Active learning is a strong baseline for data subset selection,","venue":null,"work_id":"ea122dbb-c374-4d2c-bb97-49ba6fdb3849","year":2022},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.296066Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:9ceb66efae1ae69b33f10b268e574234c0bb91f40dbbd5d116ef20719337bea3","observation_id":"06b51cf2-0a94-47f6-94e7-b1153d5eb4db","resolution":{"observed_at":"2026-08-06T18:27:58.887393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.394528Z","title":"A survey of deep active learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.394528Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:c624c1e298b3042e3543a6ab4222427093f48416c45bfc10087a939d484f0785","observation_id":"11ac99fe-fdc0-4a83-b293-35f9693a8e0a","resolution":{"observed_at":"2026-08-06T18:27:54.394528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.435303Z","title":"X-vectors: Robust DNN embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.435303Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:6e7ace6b544520d8fd002552fe688d7b881bf5a65c5dc5f1aaaf6a67f5fc5fc1","observation_id":"9f5f5c20-6de6-40fc-a736-759e88e9676e","resolution":{"observed_at":"2026-08-06T18:27:54.435303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.462331Z","title":"Ctc- segmentation of large corpora for german end-to-end speech recogni- tion,","venue":null,"work_id":"ef93e6fc-1abf-4344-bc04-a73cae09e8f3","year":2020},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.521562Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:5c161966d6483370810d55a92f2e324350e24955ea96d2b61355dc0da6515a23","observation_id":"ed20ec0e-f874-44e8-87e5-edbf9143349b","resolution":{"observed_at":"2026-08-06T18:27:58.648333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.611739Z","title":"TTSOps: A closed- loop corpus optimization framework for training multi-speaker TTS models from dark data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.611739Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:2bd5bf2f9f3d2994fe73f7713c198dcfd429104d5b09fa1616e154562d5cf8d6","observation_id":"cb737d24-bba7-41c1-bd09-3916fc06a0f6","resolution":{"observed_at":"2026-08-06T18:27:54.611739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.203973Z","title":"Speaker generation,","venue":null,"work_id":"5ecd9a47-1820-4cef-ac47-00323ce8c9de","year":2022},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.656286Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:5799857d65933fcd65bff7ddcb407b2a7aa9bb24ad94bfebd0b8147bfe4c4d40","observation_id":"145f0d5d-2e25-44fc-a068-cd37d6de6161","resolution":{"observed_at":"2026-08-06T18:27:58.324202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.954445Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"5476b7b8-c0c5-4177-b84f-0ef192f561e0","year":2020},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.696419Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:85ba4728a3d7a92d540ef7221deda3f7c3eb5ceda8d0fb9e21648c4aeff629cb","observation_id":"8362134a-5a44-41ed-84d7-06187d788644","resolution":{"observed_at":"2026-08-06T18:27:58.082996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.573700Z","title":"Diffusion models are minimax optimal distribution estimators,","venue":null,"work_id":"5b9c9c23-015d-4f4a-8709-d8a0ecf4ca22","year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.798528Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:301267aa006db61bfabf90946030f817c9a369265dbea32696b27a963b68cba3","observation_id":"b77b1d56-2df1-43db-a5f5-5d0b3149cfee","resolution":{"observed_at":"2026-08-06T18:27:57.733283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.858512Z","title":"Diffusion models in vision: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.858512Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:033a300926b4f4b80191f2b0a7099fe785ca6bf79082b351ee9360904b00003d","observation_id":"bbc22d8c-fbac-4029-b886-a39061c92b22","resolution":{"observed_at":"2026-08-06T18:27:54.858512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.272665Z","title":"ITA corpus,","venue":null,"work_id":"c32add06-52bc-468c-b995-415098d457c5","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.902307Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:7f4128c6b8f3826a76014dd36fd3432ba42145acec79ebd05b85659c13e97f93","observation_id":"f265599f-8560-478f-bb09-eed3c25b8428","resolution":{"observed_at":"2026-08-06T18:27:57.422205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.105960Z","title":"FastSpeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"23f7b5f6-abae-419b-9fe5-a62af40e1c55","year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.971264Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:ed62e9025fc9ec890d56f80a4cb9b0e972b29b227d386af8628a25d507e5b8aa","observation_id":"9e0de4fd-0987-481c-9a7b-4b4e78aca670","resolution":{"observed_at":"2026-08-06T18:27:57.190524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.970395Z","title":"HiFi-GAN: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"a25ccdaf-238f-44b7-a7de-3dbbcfc1bf5e","year":2020},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.058505Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:19ab393d8b93a936d41b9de29e06f10da831923f0e2669e94311edc416dfca19","observation_id":"7487de70-b9b8-43ba-a8b6-5cab2e462676","resolution":{"observed_at":"2026-08-06T18:27:57.046422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.730663Z","title":"HiFi-GAN,","venue":null,"work_id":"0c4af101-7d81-4572-9163-b3e56e8a8c38","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.142489Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:b45e121abfc8cafbe711eb39d8b8cd852e951bee3f152864b562054a77c122c7","observation_id":"df9a00ab-2626-49c9-8afe-8d537cc4608e","resolution":{"observed_at":"2026-08-06T18:27:56.853905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.497611Z","title":"FastSpeech 2-JSUT,","venue":null,"work_id":"537316f2-21b4-4ee9-812f-1261ad9ddeec","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.235654Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:840d67130ae9c7ac8e5a183b885781e2b1fc1f22b85d4182eca1650982997eb6","observation_id":"9d0b883e-c82b-455e-89cb-38b3568a60ed","resolution":{"observed_at":"2026-08-06T18:27:56.623802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.224925Z","title":"x-vector,","venue":null,"work_id":"c9342864-f994-46ef-ac64-fb7fb6ee7f98","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.344163Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:588e4421a32ca2c057472180cc0ea26b23e5e6d27e0537feeac4bae0a40f8619","observation_id":"3e4dca15-a0b0-4d76-b67a-1ebfdfdbcebf","resolution":{"observed_at":"2026-08-06T18:27:56.351789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T12:13:58.050102Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.08319."}