{"as_of":"2026-08-15T15:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a498467c29a490de758ccbbf1303913bfa9f29a7986eb4fe2275ca06a60dc67","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:16:16.553766Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:16:16.449810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.15626","snapshot_observed_at":"2026-08-04T16:16:16.449810Z","title":"Good morning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.449810Z"},"links":{"cited_paper":"/paper/2509.15626","citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:4a50602d33be0e9af626b371bfea6616eda9d1f1ba2a0f2bd8cc4e8907b0a8b4","observation_id":"c8f46170-3ade-4c71-80db-3cb8ad978230","resolution":{"observed_at":"2026-08-04T16:16:16.449810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.15626/citation-record","integrity":"/paper/2509.15626/integrity","json":"/paper/2509.15626/citation-record.json","paper":"/paper/2509.15626"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.446306Z","title":"The pursuit of this controllability ha s evolved through several paradigms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.446306Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:9b2603b786f06ee32f198b9ab73205bf797cc3aab0b47fddea3c533025ce153b","observation_id":"1ec7e731-7d05-4807-9709-2b17aac75f84","resolution":{"observed_at":"2026-08-04T16:16:16.446306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.15626","snapshot_observed_at":"2026-08-04T16:16:16.449810Z","title":"Good morning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.449810Z"},"links":{"cited_paper":"/paper/2509.15626","citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:4a50602d33be0e9af626b371bfea6616eda9d1f1ba2a0f2bd8cc4e8907b0a8b4","observation_id":"c8f46170-3ade-4c71-80db-3cb8ad978230","resolution":{"observed_at":"2026-08-04T16:16:16.449810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.452712Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.452712Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:d50671d79028089be4540ee64f3127f5189d0c02c0de65babe32e36c3ec6e601","observation_id":"f012559f-70b8-4d1a-957c-922c3a1b15ea","resolution":{"observed_at":"2026-08-04T16:16:16.452712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.455450Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.455450Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:eb2e0af4d63da790a05496707ecf1b2aaf037a81e921ce4c384d67d707d3876c","observation_id":"f1a8b60e-b089-48d9-a00b-2f57b9f08b84","resolution":{"observed_at":"2026-08-04T16:16:16.455450Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.461597Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.461597Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:f37f439506d7834a292e5e7dbb34749bc1d9edd31bf5130d02a39d267bbd2ba9","observation_id":"dd6bf30d-bb67-4ac5-8e42-8e2b071a2a3c","resolution":{"observed_at":"2026-08-04T16:16:16.461597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05447","last_updated":"2017-11-28T02:07:43Z","snapshot_observed_at":"2026-08-14T20:13:34.488260Z","submitted_at":"2017-11-15T08:27:35Z","title":"Emotional End-to-End Neural Speech Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05447","snapshot_observed_at":"2026-08-04T16:16:16.476550Z","title":"Emotional end-to-end neural speech synth e- sizer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.476550Z"},"links":{"cited_paper":"/paper/1711.05447","citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:028786588cc7519257e657aa42205fd703422db22e0311834c72e03da8e8aea5","observation_id":"bf7ac276-6eec-412b-b28c-d7826b9618fa","resolution":{"observed_at":"2026-08-04T16:16:16.476550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.464195Z","title":"Natural TTS synthesis by conditioning wa venet on mel spectrogram predictions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.464195Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:aecbdae2d33d94e49612781845669f901434ec81c09bb420a5308e697100a1f1","observation_id":"0ab50b66-bc07-430c-96b8-5f48c39658a7","resolution":{"observed_at":"2026-08-04T16:16:16.464195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.466542Z","title":"FastSpeech 2: Fast and high-quality end-t o-end text to speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.466542Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:3a45808f01b2edd7efad67d5ef9114b6771f1e404d10627f8b88e590fd654997","observation_id":"84dd0452-e402-4c96-bd6d-931ce6586573","resolution":{"observed_at":"2026-08-04T16:16:16.466542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.468922Z","title":"Conditional variational autoencoder wit h ad- versarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.468922Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:4ed3c3e7936ed7b86f4eba3921a51a93863ae96d4df6b6d6d63ed50bd703373b","observation_id":"015d56d4-66ef-4e02-88d1-bccd93ec00d7","resolution":{"observed_at":"2026-08-04T16:16:16.468922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.471229Z","title":"Drawspeech: Expressive speech synthesi s using prosodic sketches as control conditions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.471229Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:405ae609b1cadf1b0e32cd8f22a41e06ae8ff2787a2078980a215df3f3462266","observation_id":"46e8c101-3218-4a2d-bb7c-509f95d892e0","resolution":{"observed_at":"2026-08-04T16:16:16.471229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.473692Z","title":"VITS2: Improving quality and efﬁciency o f single-stage text-to-speech with adversarial learning and archi- tecture design,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.473692Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:7ea1c2148d028ee43354af0e90a8d203a65eed982c85de02235f93be01b55076","observation_id":"a7c3a64e-3c1e-41e3-a571-3d1673e0a9dc","resolution":{"observed_at":"2026-08-04T16:16:16.473692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.492056Z","title":"Emosphere++: Emotion-controllable zero- shot text-to-speech via emotion-adaptive spherical vecto r,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.492056Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:fbb51f57533354dd8c4029a46c11aa081c5563bd280fd4a8fd30341f966f2c2b","observation_id":"951b728a-bc7c-453a-8841-99f3d34edf31","resolution":{"observed_at":"2026-08-04T16:16:16.492056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.480090Z","title":"EmoSpeech: guiding fastspee ch2 towards emotional text to speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.480090Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:ead184ba2abe9158c64f380c0e03315f52ebe9014bc7f658126eedb535b6bdd7","observation_id":"d1bc7f1d-a36a-4b20-a3b6-234c8606732c","resolution":{"observed_at":"2026-08-04T16:16:16.480090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.482463Z","title":"Transfer learning from speaker veriﬁcati on to multispeaker text-to-speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.482463Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:d17c4f21f3fcc00ea3d64533619a587da21c4b9c88ab6550556ea7871d9b6094","observation_id":"be1f0581-7f5d-41d8-8cbb-83f827d9de85","resolution":{"observed_at":"2026-08-04T16:16:16.482463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.485183Z","title":"YourTTS: Towards zero-shot multi- speaker TTS and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.485183Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:d3996dfb53fff205db50e3995a6d0553950579205bd09e42d9aa203058798316","observation_id":"6bad8361-2893-42c6-8f94-c8a47f396a50","resolution":{"observed_at":"2026-08-04T16:16:16.485183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.487726Z","title":"Style tokens: Unsupervised style model ing, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.487726Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:cb1859c1305508ca37d714fd1c472023853e0cd01c97ab5a5a3fd9484d17ff51","observation_id":"83867d02-350c-4943-8c93-18c879086333","resolution":{"observed_at":"2026-08-04T16:16:16.487726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.489895Z","title":"EmoSphere-TTS: Emotional style and i n- tensity modeling via spherical emotion vector for controll able emotional text-to-speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.489895Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:aed757ebffec8814aaac571aa02360d5bbdd32d172e49bea2f28cef70656d273","observation_id":"245d0775-a212-49cd-bc29-40125ba54821","resolution":{"observed_at":"2026-08-04T16:16:16.489895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.506293Z","title":"V oiceMe: Personalized voice genera tion in TTS,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.506293Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:df21be74c2c9b8dcdf6000e4fd735c7c9d7a7960e74a847c8a4850a06fb5ac3a","observation_id":"8731e8f1-556f-4854-8a92-04e838e7e60b","resolution":{"observed_at":"2026-08-04T16:16:16.506293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.494263Z","title":"Prompttts: Controllable text-to-speec h with text descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.494263Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:482e3614432e738ddc8e58e282b55d527617aab304300a98328511193301cdfd","observation_id":"f84b5efe-1652-4406-84f8-50a71769fab5","resolution":{"observed_at":"2026-08-04T16:16:16.494263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.496508Z","title":"Promptstyle: Controllable style transf er for text- to-speech with natural language descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.496508Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:89398e551a771a24999e98918fdf735d960a8f841e3168363e425f60106f44c9","observation_id":"61481665-9243-436d-8f9d-659d4c1bd9eb","resolution":{"observed_at":"2026-08-04T16:16:16.496508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.498763Z","title":"Instructtts: Modelling expressive tts in discrete latent space with natural language style prompt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.498763Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:c2ab2068b3cd0ca21df757434a0b6974def72af922b54ae84ffab901b2c29bd9","observation_id":"7397bca3-59a0-4b0b-891d-f15817851bae","resolution":{"observed_at":"2026-08-04T16:16:16.498763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.501241Z","title":"Prompttts++: Controlling speaker i dentity in prompt-based text-to-speech using natural language descrip- tions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.501241Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:947b1985cec7a54609028ca4561cb2597a84c38db9a349d735e705950ba43985","observation_id":"398bf644-8a9c-4d82-bfc8-b56dc86793f1","resolution":{"observed_at":"2026-08-04T16:16:16.501241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.503300Z","title":"LibriTTS-P: A corpus with speaking style and speaker identity prompts for text-to-speech and s tyle captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.503300Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:2280f91864fdeaf2d311aaa7c6c6a2a4e0aa22dfa0ab366777b64f4ec86fdbc4","observation_id":"a873d0e3-0867-4159-b9f1-f681c1c1effd","resolution":{"observed_at":"2026-08-04T16:16:16.503300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.520606Z","title":"LibriTTS-R: A restored multi-speak er text- to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.520606Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:1c1d47ff35a55088ed7d04c3503ab516764d4a1a86e6d239c9e75d0dde0b11e3","observation_id":"685d3be6-441d-4265-afb4-62313a4e914d","resolution":{"observed_at":"2026-08-04T16:16:16.520606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.508430Z","title":"Controllable generation of artiﬁcial sp eaker em- beddings through discovery of principal directions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.508430Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:4de7e2df1ee55f6589726a75dc63484aa0d914d9acf3c23c0166e7775c45389f","observation_id":"2652dbad-a375-47fb-a505-d4be2fa01b2f","resolution":{"observed_at":"2026-08-04T16:16:16.508430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.510747Z","title":"Speech synthesis along perceptu al voice quality dimensions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.510747Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:6a98ea754d960bd4467686dd2622392492d4bf6a1d5cc8a89994be31231af0e0","observation_id":"7dee22d0-7c87-4c6e-9703-692ee92ab86f","resolution":{"observed_at":"2026-08-04T16:16:16.510747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.513250Z","title":"Extraction of everyday expression asso ciated with voice quality of normal utterance,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.513250Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:bdf63263a17f6d6aae20fb6fb658614213d094a1db69cbfc1b6d4db5ee5985de","observation_id":"a10e2253-bece-4fe8-87fa-a14aa50907a8","resolution":{"observed_at":"2026-08-04T16:16:16.513250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.515665Z","title":"The inﬂuence of semantic primitives i n an emotion-mediated willingness to buy model from advertisin g speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.515665Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:4c18bb17063a2f3513efa97848c0ddb2848ccf00a584ca83e8efe604fab2ad11","observation_id":"fe7e4a39-a766-4580-9ad6-f995d7776189","resolution":{"observed_at":"2026-08-04T16:16:16.515665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.518276Z","title":"V oice impression control in zero-sho t TTS,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.518276Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:84fb7712c6ae4c2b993dccef5a59ccd0170eef6d504a7aa2f40845867e2e3b3d","observation_id":"8bb62c49-0314-46b9-97b7-7ded8c5bc970","resolution":{"observed_at":"2026-08-04T16:16:16.518276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.533794Z","title":"Perceptual (but not acoustic) featur es predict singing voice preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.533794Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:3ab297de5bfc654bef4041d59f5736fa4594080802be6b0cfabc54787ce05266","observation_id":"981f2684-1208-4723-a679-46b01008d629","resolution":{"observed_at":"2026-08-04T16:16:16.533794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.522883Z","title":"Hubert: Self-supervised speech repre - sentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.522883Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:0c489f10c7b17ca74ca960460489cb15d2e94027fd2cebcad7660a7bd55b3a04","observation_id":"3582749e-c6f8-48d6-83a4-98c2e139730c","resolution":{"observed_at":"2026-08-04T16:16:16.522883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.525097Z","title":"Unsupervised domain adaptation by backpropagation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.525097Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:6dd3f648cabb04d97cdeacae1350413cd0451c696a90a412e1315486d9d056b5","observation_id":"dfb8cb05-b44c-4156-b68a-7c57d1030d01","resolution":{"observed_at":"2026-08-04T16:16:16.525097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.527255Z","title":"whisper-timestamped,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.527255Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:cb61bbc5de30a1bbdbf4a3a8717e4bec379bfe7ccba95e39bb464c643951a41e","observation_id":"b75fc487-2aa5-4484-93e6-1d41b6be4bb1","resolution":{"observed_at":"2026-08-04T16:16:16.527255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.529430Z","title":"Krippendorff, Content Analysis: An Introduction to Its Methodology, SAGE Publications, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.529430Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:1ef706f033116ddcfe1412f4123df533b54ef2b63e79f0c8d3c2d11f190f56f6","observation_id":"6c8bf5a1-3660-40a8-a45b-d1476202966d","resolution":{"observed_at":"2026-08-04T16:16:16.529430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.531611Z","title":"Ramas: Russian multimodal corp us of dyadic interaction for affective computing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.531611Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:af9ee03b60cc30276e2515b6ad10670b901ac6bbf2d582d8ce63beecead419d4","observation_id":"4ad0591b-ba22-4c9f-816b-9ebac6ea1382","resolution":{"observed_at":"2026-08-04T16:16:16.531611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.547299Z","title":"Scalable diffusion models with tran sform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.547299Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:091b7a79dacba91ffb012827a7d20db5e0c867d80f5c83143190e774bb69bd0b","observation_id":"486b4487-850d-4634-96c1-09aa0652e23f","resolution":{"observed_at":"2026-08-04T16:16:16.547299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.536083Z","title":"WavLM: Large-scale self-supervised pr e- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.536083Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:9d5e45fb5dbf2cd5554fe44cca5988a76678fe06df1523b7b89db5fff904578a","observation_id":"e42601ae-2a8b-4739-82d0-5435b22f1a8d","resolution":{"observed_at":"2026-08-04T16:16:16.536083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.538123Z","title":"Conformer: Convolution-augmented t rans- former for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.538123Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:3eb4a54e106870f235c65fd0e8f682900f6323c839baa2f9623ef797a42efd51","observation_id":"b0495ff2-951a-4de6-b255-a812e73cf735","resolution":{"observed_at":"2026-08-04T16:16:16.538123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07840","last_updated":"2021-10-15T03:27:45Z","snapshot_observed_at":"2026-08-13T17:52:45.989658Z","submitted_at":"2021-10-15T03:27:45Z","title":"ESPnet2-TTS: Extending the Edge of TTS Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07840","snapshot_observed_at":"2026-08-04T16:16:16.540545Z","title":"ESPnet2-TTS: Extending the edge of T TS research,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.540545Z"},"links":{"cited_paper":"/paper/2110.07840","citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:cfc315ad055cd78f182cdf7baa6162c65d08a6bf32fae21dbe73140571307697","observation_id":"6c06d6a4-0cce-473c-9f90-0cca43d652d5","resolution":{"observed_at":"2026-08-04T16:16:16.540545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.543025Z","title":"HierSpeech: Bridging the gap between text and speech by hierarchical variational inference using sel f- supervised representations for speech synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.543025Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:9f4793df1bf55d1834063cacc4520d2e0c449029e204a0b2645bd4f647f8dfc2","observation_id":"bf656eb7-9900-4ddc-8062-31f646856548","resolution":{"observed_at":"2026-08-04T16:16:16.543025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.545193Z","title":"HierSpeech++: Bridging the gap betwe en semantic and acoustic representation of speech by hierarch i- cal variational inference for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.545193Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:fc9d2738f517e10d203c31ad4436164d6564bb0cf774a4ddd429446a98b58a72","observation_id":"a2fe2f1f-655f-41bc-bcd0-7391702321bc","resolution":{"observed_at":"2026-08-04T16:16:16.545193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.549448Z","title":"Robust speech recognition via large -scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.549448Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:0d09a08cfe7ffaf0130f1f7156f4b23f8f944f8ee558ac251d0ff0a644911a7e","observation_id":"5d22760d-728e-4f7f-9079-a4d9c316c671","resolution":{"observed_at":"2026-08-04T16:16:16.549448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.551571Z","title":"UTMOS: Utokyo-sarulab system for voic emos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.551571Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:2f04596dc68a94cdf89516bda2cb43af683a57981edfd140825f40a9d06db6ca","observation_id":"90093b0e-ab27-4eeb-9309-3c3ded6a6d4c","resolution":{"observed_at":"2026-08-04T16:16:16.551571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.553766Z","title":"Resemblyzer,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.553766Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:467fe7505eefc48cb13ddcfa71f96c517e02f6d145a272fbc13230d2244fcf96","observation_id":"824ae36d-036c-4a23-ad8f-d17931daa896","resolution":{"observed_at":"2026-08-04T16:16:16.553766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:16:16.459147Z","title":"VI Condition base sep rfg A Mod","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control","version":4},"reference_index":8555,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:16.459147Z"},"links":{"citing_paper":"/paper/2509.15626"},"observation_digest":"sha256:60cdd659c87c9055cfc5fa1f0a1d0101b6e475ac8a995aeffcf49cc91a84b34a","observation_id":"0c4ad513-04d1-475c-982e-5f88bc4084bf","resolution":{"observed_at":"2026-08-04T16:16:16.459147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.15626","last_updated":"2026-06-16T07:13:45Z","latest_version":4,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T13:13:41.104826Z","submitted_at":"2025-09-19T05:43:15Z","title":"LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2509.15626."}