{"as_of":"2026-08-08T00:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f24e7b8665678dcf4ec637c19fc9ad1d0af4b278c23cb9be7af68d59ea716c2","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:20.365775Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:20.110093Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T19:07:18.246563Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-08-07T10:55:20.110093Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.110093Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2913861f2dc309c8fcb9ddba7bf69dc9f556ffe754dd35a49fab320e266fd55f","observation_id":"ba314579-786e-4c6b-a2b0-691e19b159d0","resolution":{"observed_at":"2026-08-07T10:55:20.110093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":"2506.04013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-07-02T19:07:18.246563Z","title":"N., and Waibel, A","venue":null,"work_id":"3ad73415-6202-4d0f-b638-1349573ccafa","year":2025},"citing_paper":{"arxiv_id":"2605.03039","last_updated":"2026-05-04T18:06:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T18:06:17Z","title":"Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-08T19:11:30.638672Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2605.03039"},"observation_digest":"sha256:ab21e4f66ba49bc2a9f2467a274de3d33af030649b3eb6606a7ef1c2740e54de","observation_id":"ca35d848-c3ba-4ab9-bd33-71cd9388e510","resolution":{"observed_at":"2026-05-09T06:00:36.608042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":"2506.04013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-07-02T19:07:18.246563Z","title":"N., and Waibel, A","venue":null,"work_id":"3ad73415-6202-4d0f-b638-1349573ccafa","year":2025},"citing_paper":{"arxiv_id":"2606.07240","last_updated":"2026-06-05T13:09:21Z","snapshot_observed_at":"2026-08-05T07:23:40.814546Z","submitted_at":"2026-06-05T13:09:21Z","title":"KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T21:39:11.265338Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2606.07240"},"observation_digest":"sha256:7bd374f6c488d55ce3cbc33109c4cace93cbf0a6c87bf70a73b4bdef15944379","observation_id":"ad6d5a5a-38a2-4068-a167-03f84c166bfe","resolution":{"observed_at":"2026-07-02T19:07:18.248088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04013/citation-record","integrity":"/paper/2506.04013/integrity","json":"/paper/2506.04013/citation-record.json","paper":"/paper/2506.04013"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.851403Z","title":"Conventional VC models perform well in replicating speaker identity but struggle when the target speech is highly expressive","venue":null,"work_id":"60652f79-ccea-4ac5-9129-57e4709a4dff","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.100974Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:8a25dc28346a63f491cfe8a4052e52e393be685904cf04f6cc54f3a9564011a4","observation_id":"73dae815-3c55-4526-84c8-912be14e0f2d","resolution":{"observed_at":"2026-08-07T10:55:20.855135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.842733Z","title":"These models typically required text supervi- sion","venue":null,"work_id":"77c5a489-6d93-478d-8d4b-0164db04efd9","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.105713Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:a02cbdb2d212ab10173a797f0251c2b5074d0e11564e89a83dec0d9b47d5630f","observation_id":"60d15bb1-2e4b-439f-9dfc-c7c6aa33ce69","resolution":{"observed_at":"2026-08-07T10:55:20.845772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.831249Z","title":null,"venue":null,"work_id":"543fda8b-b7c3-4ebf-ac84-56395daa1a2a","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.113786Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:61bf5479fc1f0a4436ec61e60b835e04e3d0f88326a2524b2af31ea54af0b597","observation_id":"2b05af34-6da4-4dab-be57-1f5d46dc096c","resolution":{"observed_at":"2026-08-07T10:55:20.837000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.822040Z","title":"All datasets are English and total duration is around 228 hours with more than 920 speakers","venue":null,"work_id":"b31bd260-b9bb-48cb-9ce7-4101b7bdc0b5","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.117679Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2b3039d2da1d9f1a4415b67415b0eb829786d2a62a77d9be0c3f5300478a74ac","observation_id":"d66535c6-1087-46f6-aa49-3738da5f3ba0","resolution":{"observed_at":"2026-08-07T10:55:20.825514Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.812217Z","title":null,"venue":null,"work_id":"266c787c-3808-4867-a8d4-13abe47b98f8","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.121966Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:e4dfd23726c0a6a4421dfcfde758db36b954b488e136f514bc5bb29397b405ec","observation_id":"89c442f2-6f5c-4f5a-8dd8-d074ee68083e","resolution":{"observed_at":"2026-08-07T10:55:20.816313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.802667Z","title":null,"venue":null,"work_id":"7a2f661f-d87a-4196-8684-6ef9622c9cae","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.125796Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:181416eb48e838fa7ee9a737fdaf22cceee2d120fb04d3880a5e7237dd55404b","observation_id":"e262b5f6-fc04-414b-a4fc-43b864e1852d","resolution":{"observed_at":"2026-08-07T10:55:20.805968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.756823Z","title":"Styles2st: Zero-shot style transfer for direct speech-to- speech translation,","venue":null,"work_id":"fd9b1103-c9e2-43be-bac2-2bf2f1c32984","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.151933Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:3a51aa090febb9a03aebdfb39315a61c080cf2a4aaa1467ce0ec3a84d82fdd85","observation_id":"92367e0f-9cda-4004-997d-3c19c61642e7","resolution":{"observed_at":"2026-08-07T10:55:20.760631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.793661Z","title":"Chil: Computers in the human interaction loop,","venue":null,"work_id":"a6eb5aee-7047-4d6b-8ad5-83b583fba1c1","year":2005},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.129443Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:1aac7674e54c395ebb7cc458ac595512ae0ce7119ccd960319be34b46fba85a2","observation_id":"c660e27c-596c-48f2-9e38-a14f95eef46e","resolution":{"observed_at":"2026-08-07T10:55:20.796781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.784835Z","title":"Towards an open-domain social dialog system,","venue":null,"work_id":"5d5a555d-e18c-4686-82e9-5c9195e4f2b9","year":2017},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.132609Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:15517da3278f1288d678c4189562d0dd79c02bf7235e4195ca449778fe2ce4cf","observation_id":"ad0ef1ef-5d7f-465f-b9f1-e912a536f3a0","resolution":{"observed_at":"2026-08-07T10:55:20.788033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.775808Z","title":"Face-dubbing++: Lip-synchronous, voice preserv- ing translation of videos,","venue":null,"work_id":"6867449e-2d71-4326-b33d-ac886daa9065","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.136544Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:32aca3ca8cbde996fab4abc5e9a8ddd65dea08dd37c84075c74cd82e2d7a3718","observation_id":"25550670-15b0-48b7-9b2b-280828d1941b","resolution":{"observed_at":"2026-08-07T10:55:20.779015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05088","last_updated":"2024-11-07T19:11:55Z","snapshot_observed_at":"2026-08-02T01:14:23.877587Z","submitted_at":"2024-11-07T19:11:55Z","title":"Findings of the IWSLT 2024 Evaluation Campaign","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05088","snapshot_observed_at":"2026-08-07T10:55:20.139760Z","title":"Findings of the iwslt 2024 evaluation campaign,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.139760Z"},"links":{"cited_paper":"/paper/2411.05088","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:ab4c3599985a3c78e0b6de27d041a60c32bf74e12c2d1f754199e9305bb41754","observation_id":"c9a77ed3-3ba0-4d54-8e9e-3620d532acd9","resolution":{"observed_at":"2026-08-07T10:55:20.139760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-08-07T10:55:20.110093Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.110093Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2913861f2dc309c8fcb9ddba7bf69dc9f556ffe754dd35a49fab320e266fd55f","observation_id":"ba314579-786e-4c6b-a2b0-691e19b159d0","resolution":{"observed_at":"2026-08-07T10:55:20.110093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.766635Z","title":"Simultaneous translation of open do- main lectures and speeches,","venue":null,"work_id":"c3f041f4-4f90-4e48-9a8d-293fd5813912","year":2012},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.144697Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:022e1edec56b60cc073c841a266bdc031202ab78ec3b2238a60757d9182c9f42","observation_id":"0ab7ae64-8fa2-4efe-ba84-aec402de6f5e","resolution":{"observed_at":"2026-08-07T10:55:20.770020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T10:55:20.148186Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.148186Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:54e317fb4415047d7a9f2ad91704c80485d28ddd365fa3c7593e2054fe9860c5","observation_id":"c9f3b311-7eea-48d9-9bb0-b849850a81b0","resolution":{"observed_at":"2026-08-07T10:55:20.148186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.746899Z","title":"Limited data emotional voice conversion leveraging text-to-speech: Two-stage sequence-to- sequence training,","venue":null,"work_id":"5f3a0f1a-327c-487d-8aed-13d46b91bed9","year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.155032Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:21e4b674b408ecedb1c558a7076f97ff802175be95971788de6e9d6e632864de","observation_id":"5a98814b-9b96-409e-8a88-75df122dd784","resolution":{"observed_at":"2026-08-07T10:55:20.750351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.737143Z","title":"Nonparallel emotional speech conversion,","venue":null,"work_id":"0c03371f-2bcf-41b4-a240-fefb11ae4b11","year":2019},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.158385Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:ce74508093a92ff7ee58a57e3b689d213355e9a17215b772c6e1f39484c2e611","observation_id":"28febc5b-ccf0-467a-95d5-5131f4e549e8","resolution":{"observed_at":"2026-08-07T10:55:20.740558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.727592Z","title":"Nonpar- allel emotional speech conversion using vae-gan","venue":null,"work_id":"239e5cbb-4216-4d6d-b955-c216aafd3e16","year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.161449Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:3c16af3a67f095c02b7eca588342410c8f0d96052feec3e19ec72afb85a821e7","observation_id":"c9294002-d084-43b3-b41f-78731dc9f955","resolution":{"observed_at":"2026-08-07T10:55:20.730923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.717810Z","title":"Textless speech emotion conversion using discrete and decom- posed representations,","venue":null,"work_id":"8c5bc130-3b7b-45a7-a3e7-9ea96610472a","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.165248Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2e6897f681d062358d1751c7c85e296610313f382484045e15266ca58bdfdd36","observation_id":"90cacd4e-433b-4991-b40f-d1fb14fc9821","resolution":{"observed_at":"2026-08-07T10:55:20.721511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.708088Z","title":"Hiervst: Hierar- chical adaptive zero-shot voice style transfer,","venue":null,"work_id":"cef718d2-61bf-4213-8395-0bd5516badf5","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.168157Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2d826128ca04a1b3402acc512efa76d974ddc66e96cc68041dabb4ab2c6f61f6","observation_id":"3e6b91b7-04d0-456e-8398-c26d7a5e7f41","resolution":{"observed_at":"2026-08-07T10:55:20.711516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.697565Z","title":"Expressive-vc: Highly expressive voice conversion with attention fusion of bottleneck and perturbation features,","venue":null,"work_id":"1cd7b2af-e850-417b-b222-c2e5fdeaba7d","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.172054Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2285004c91a587b019db8f6d111993c5702f42f3c3b6ac5d0500e775e4cb2d4f","observation_id":"c5850056-bcc9-495f-af8a-9b5d27e67111","resolution":{"observed_at":"2026-08-07T10:55:20.701184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.686673Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"1c61f5be-da3c-4f85-a269-b136bae60b35","year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.176032Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:78088449033e2ecb948676bf25a62a9882e6352dfc3bae4762ae8097a25542d6","observation_id":"aec52e0c-9e09-44f4-8d98-c38be0db8dcc","resolution":{"observed_at":"2026-08-07T10:55:20.690149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.677091Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":"2f841114-c003-4c50-9cbf-e03cdf84265f","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.179658Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:3186af4547300b9c64b128895c992a5f38aa576eaf1b787dac01d4b6dcd421d5","observation_id":"da85ec13-5aee-4693-b038-fcfb0199455f","resolution":{"observed_at":"2026-08-07T10:55:20.680603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.667550Z","title":"mhubert-147: A compact multilingual hubert model,","venue":null,"work_id":"3b7168cf-1436-468a-81ee-b9de30c75daa","year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.183562Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:727e58fa15ac20dff7062dcdbe0b14bb3be82ad8e241f6894fbeff2e8a2710de","observation_id":"c3e35a3f-36c7-449b-b665-11c3fdf4c2da","resolution":{"observed_at":"2026-08-07T10:55:20.670869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.657857Z","title":"V oice privacy- investigating voice conversion architecture with different bottle- neck features,","venue":null,"work_id":"ffac3617-089a-45ae-a718-7d9e65b12535","year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.186998Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:375dad192b3b20ed250e293420fb81002f8122931d112949bce5660fddb3ecc7","observation_id":"10c8d12d-7494-4972-a593-9ecf7d8b2fb6","resolution":{"observed_at":"2026-08-07T10:55:20.661268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.648125Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to- speech,","venue":null,"work_id":"5fa37322-cf01-4ac8-ad67-45f3ec286a66","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.190765Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:36dca59b72d9d5b1fb8f7a113f716e96021aae62ca2a6b8bc6f7fd75a5f4677a","observation_id":"92ec07ed-625a-468a-9f3f-fbd34e7cb781","resolution":{"observed_at":"2026-08-07T10:55:20.651408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.194507Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.194507Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:dc76aa6dde98652cb491d3c20cd76bc5fabcbad58fe26cd65e39934f1fbb0ff6","observation_id":"4d272469-5516-4d6f-8533-831cf5137352","resolution":{"observed_at":"2026-08-07T10:55:20.194507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.633549Z","title":"Emotion intensity and its control for emotional voice conversion,","venue":null,"work_id":"8233273c-6ab1-4119-a9bf-44ff43a20c71","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.197913Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:560b58da0cb8714dd1564ac1962afb93cce9f4157009454491701b1515af53ae","observation_id":"5910ef84-2008-41a0-a9c6-2d41bbdbac57","resolution":{"observed_at":"2026-08-07T10:55:20.636704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.623577Z","title":"Accent conversion using pre-trained model and synthesized data from voice conver- sion","venue":null,"work_id":"867a2e53-c66c-45ce-b823-ab97d98ceb10","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.294744Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:4393b6228b1b9e4b1ead22b581bd784bdeda9172293e77eb5a86b17681e42af9","observation_id":"20b2f702-bbf1-430c-b7e3-baaee31197d3","resolution":{"observed_at":"2026-08-07T10:55:20.627065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.613568Z","title":"Improving pronunciation and accent conversion through knowledge distilla- tion and synthetic ground-truth from native tts,","venue":null,"work_id":"d5f98631-50ca-4595-9228-2ca3b0604f34","year":2025},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.298990Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:3b84cd0f5f7b8253c40e08703a5d5fecaf676d00ef985bfa5a7d6b975050d747","observation_id":"2e0dc039-9d98-47b0-96f2-9f98dbf965b3","resolution":{"observed_at":"2026-08-07T10:55:20.616973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.603712Z","title":"Stargan for emo- tional speech conversion: Validated by data augmentation of end- to-end emotion recognition,","venue":null,"work_id":"809a9735-bc8f-41dc-829e-47f96be1e2f3","year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.302169Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:a90d69dd285cce300bf23cc51d02c567c6d5538ef86da5dc7a4f3403112c544f","observation_id":"e8cf2831-0a5b-4443-aa8a-5b00fb0bde59","resolution":{"observed_at":"2026-08-07T10:55:20.607359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05695","last_updated":"2021-01-14T16:18:53Z","snapshot_observed_at":"2026-08-04T20:19:13.714500Z","submitted_at":"2021-01-14T16:18:53Z","title":"EmoCat: Language-agnostic Emotional Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05695","snapshot_observed_at":"2026-08-07T10:55:20.306160Z","title":"Emocat: Language-agnostic emotional voice conver- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.306160Z"},"links":{"cited_paper":"/paper/2101.05695","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:bfd8a78551ae996866bab41dabbc7b18b2259f9ef433d9abaf68fd554e20db4c","observation_id":"9d68f57f-7d99-40b1-9cb3-0fcb5d3b92f9","resolution":{"observed_at":"2026-08-07T10:55:20.306160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.594157Z","title":"V oice conversion with just nearest neighbors,","venue":null,"work_id":"4105e0a7-d699-4a6d-8d97-b17dffbc2e8d","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.309572Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:c9157328a56b19509e8b6cf9807fdc27ad9f9eaffffc94ab9c9eecdda9a8b06b","observation_id":"95c0fc03-f874-48e2-8517-fe0d1d91aed8","resolution":{"observed_at":"2026-08-07T10:55:20.597489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.584486Z","title":"Disentangling prosody representations with unsupervised speech reconstruction,","venue":null,"work_id":"834e9f27-1cb1-422d-a644-05a9a00e6245","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.312653Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:0b2ee7addb162ba4f7a2b017405281c4d1679cfb200f3d015cb9a6b7ff9490da","observation_id":"03777a17-2dc4-4fa3-8d3d-4eb9d74b8b6a","resolution":{"observed_at":"2026-08-07T10:55:20.587981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.573905Z","title":"Using joint train- ing speaker encoder with consistency loss to achieve cross-lingual voice conversion and expressive voice conversion,","venue":null,"work_id":"77c4c4e3-4e7a-4726-b754-0466c428bb19","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.315921Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:02557836908bf3561d46a0fc671d2c5cc544666a721711d7f283530bed13fba4","observation_id":"b804b6f8-c9b6-4dea-a3cf-412b9b014202","resolution":{"observed_at":"2026-08-07T10:55:20.577501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.562947Z","title":"X-e-speech: Joint training framework of non- autoregressive cross-lingual emotional text-to-speech and voice conversion,","venue":null,"work_id":"e89753d8-83db-4108-9945-611dab0ae0ea","year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.319244Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:30e9b032f8c2bb7589fe4ce365b357765b898f24a22015ee548706b6171034e3","observation_id":"70f5d6af-002d-4d63-b689-720df816fb73","resolution":{"observed_at":"2026-08-07T10:55:20.566994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.552631Z","title":"Zse-vits: A zero-shot expressive voice cloning method based on vits,","venue":null,"work_id":"684b0ec4-937c-496d-92b9-573b3a8f9591","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.322515Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:3fd733817e10b772d481ebaf3e43c53253317033850a86a29cd9591fae5b182b","observation_id":"2613bdb2-d8e8-4fd1-acf3-8c897598eabc","resolution":{"observed_at":"2026-08-07T10:55:20.556372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-07T10:55:20.325815Z","title":"Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.325815Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:62367263fce508a6837032dcda3e3ce0d7e2de7cdd2c4e32c2d4f924ba83354d","observation_id":"465a0c8c-bb1e-4e75-8021-eb5edcc90a2c","resolution":{"observed_at":"2026-08-07T10:55:20.325815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16430","last_updated":"2023-07-31T06:36:44Z","snapshot_observed_at":"2026-07-31T08:29:18.834101Z","submitted_at":"2023-07-31T06:36:44Z","title":"VITS2: Improving Quality and Efficiency of Single-Stage Text-to-Speech with Adversarial Learning and Architecture Design","version":1},"cited_work":{"arxiv_id":"2307.16430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16430","snapshot_observed_at":"2026-08-07T10:55:20.422366Z","title":"VITS2: Improving Quality and Efficiency of Single-Stage Text-to-Speech with Adversarial Learning and Architecture Design","venue":"cs.SD","work_id":"78356ef2-b015-4d0e-ab2e-1b7f016963f2","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.329181Z"},"links":{"cited_paper":"/paper/2307.16430","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:edebbef1d7548461079163b7f9022c86c8c62b86ada98f02c52fa4576628951d","observation_id":"da1d2bd3-e7b9-4952-b276-cfb28b0a60f6","resolution":{"observed_at":"2026-08-07T10:55:20.427901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.541714Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"976c2cbf-bf36-455c-a4d9-31145ea196f1","year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.333182Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:1499b59b5f8daf9c6d6d95e12c43651b0d38343764baafe358e1c886c63f5025","observation_id":"cdd4abe5-1b3c-4335-b5e3-418d8ea4ea1a","resolution":{"observed_at":"2026-08-07T10:55:20.545193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.531378Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"eb89528d-7c9b-43a8-a9e5-b6b6522218ee","year":2019},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.336222Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:3bc03af7fc92d40e5fc3c51fdbda6b18beb183ac480337405f711ef5f9e44851","observation_id":"2f69c47b-1579-421b-8de8-6ab66a58c7f5","resolution":{"observed_at":"2026-08-07T10:55:20.534957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.521074Z","title":"Seen and unseen emo- tional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"67682305-76c3-4d73-9e77-476a24a29f3f","year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.339190Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:932e64a1f39a4618e2044e7b131c54771a370407384824fe2f4b5aef3b0c30c7","observation_id":"fe8a54c9-162f-4886-a27f-b26498b66e42","resolution":{"observed_at":"2026-08-07T10:55:20.524960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-07T15:49:16.814852Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T10:55:20.342184Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.342184Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:b1a41c454614a73c31ea7ff6d5a0656a5dd6033747b351bc9a77b18b4b648faf","observation_id":"b1d1b093-dbc2-468e-83ea-b92226d3d12a","resolution":{"observed_at":"2026-08-07T10:55:20.342184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-07-06T16:04:58.235073Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-07T10:55:20.345371Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.345371Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:f28a7ac65d7a1ac8f3f6ef5ebc663013925514094a36bb5538f6d1a6ff4d1b54","observation_id":"a5e2b151-c0e1-4e2c-beb8-922275a56e54","resolution":{"observed_at":"2026-08-07T10:55:20.345371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.349892Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.349892Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:8b5eeab79405e9f088f23ec4648a8794136a68331cc2f69eb96126413fa8581b","observation_id":"76475748-f2ec-45c9-b57d-617c56837d54","resolution":{"observed_at":"2026-08-07T10:55:20.349892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T10:55:20.353059Z","title":"Emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.353059Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:ac9025091e775c10ef1212a906f68844c08621359cc2508f969acb9833e9db1a","observation_id":"2c0e4eed-aa8b-4d57-84ec-3030fd4b73d1","resolution":{"observed_at":"2026-08-07T10:55:20.353059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.505141Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":"cf8e9785-ab41-4499-b5e9-b7ba5f8b4437","year":2018},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.356312Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:9111d2b1a1b2b42d4c33665641b8af364e4fd16090fdac261b35f731435aa488","observation_id":"4933fb26-7b1b-41ba-a702-96cae9263b1a","resolution":{"observed_at":"2026-08-07T10:55:20.508696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.494762Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"a1f833ad-5b42-4088-a48f-13cdbd0a1b79","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.359499Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:a233ec736f699fbf2ff3ecab5a080b765b0ad09ea44792868f5d0a02d36ec291","observation_id":"90739c25-a623-4060-a345-6fcf22a17a06","resolution":{"observed_at":"2026-08-07T10:55:20.498394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.362733Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.362733Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:42abda4ff9866935f68de64db19633a1ded03160831ca8b094a36174198d4ff8","observation_id":"48e54d4e-5efa-4b12-8455-e53b9a662115","resolution":{"observed_at":"2026-08-07T10:55:20.362733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.479317Z","title":"A database of german emotional speech","venue":null,"work_id":"5faa4573-3edd-40a9-8227-24534cab6a03","year":2005},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.365775Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:bad24b196730ac05d122d8ec3c54e0e24a04719546dfd7c85767494c3540fcc5","observation_id":"f0698fca-027e-419d-a48e-4d851c7edf2b","resolution":{"observed_at":"2026-08-07T10:55:20.482825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T10:47:02.573636Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 3 inbound Pith citation observations for arXiv:2506.04013."}