{"as_of":"2026-08-08T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2748e0f1d1e61d3ba2803dd7814c409e50d02ecf236b810d6ca4f2b92218e0d0","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:58.610208Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:31:12.289334Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16691","snapshot_observed_at":"2026-08-03T00:31:12.289334Z","title":"EZ-VC: Easy zero-shot any-to-any voice conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28770","last_updated":"2026-07-30T18:44:22Z","snapshot_observed_at":"2026-08-07T13:22:10.318057Z","submitted_at":"2026-07-30T18:44:22Z","title":"Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T00:31:12.289334Z"},"links":{"cited_paper":"/paper/2505.16691","citing_paper":"/paper/2607.28770"},"observation_digest":"sha256:ed7acebd72fcd3e59d1f4e1d0e723c74723b44f7414bad3cbb7791c84143cb70","observation_id":"ca3a5311-a37c-4fe1-a337-b0f3b844df9c","resolution":{"observed_at":"2026-08-03T00:31:12.289334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16691/citation-record","integrity":"/paper/2505.16691/integrity","json":"/paper/2505.16691/citation-record.json","paper":"/paper/2505.16691"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.02418","last_updated":"2023-04-30T17:46:06Z","snapshot_observed_at":"2026-08-08T20:45:26.173082Z","submitted_at":"2021-12-04T19:50:29Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot Voice Conversion for everyone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.02418","snapshot_observed_at":"2026-08-07T14:58:56.253851Z","title":"Preprint, arXiv:2112.02418","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.253851Z"},"links":{"cited_paper":"/paper/2112.02418","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:d153ecbb89b3dc27aae6e8e1fb18255fc20593bad16c09cfacb62c630d431e67","observation_id":"d0f6a7af-550c-4223-a65f-d92468978971","resolution":{"observed_at":"2026-08-07T14:58:56.253851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00837","last_updated":"2024-07-02T17:23:44Z","snapshot_observed_at":"2026-08-06T16:32:04.612397Z","submitted_at":"2024-06-30T21:40:26Z","title":"Towards Robust Speech Representation Learning for Thousands of Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00837","snapshot_observed_at":"2026-08-07T14:58:56.363483Z","title":"IEEE Journal of Se- lected Topics in Signal Processing, 16(6):1505–1518","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.363483Z"},"links":{"cited_paper":"/paper/2407.00837","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:d6b00cefe8c72bf2c4ef567932709fc592c42a882c8e4f65f54acbdab4e7c9ea","observation_id":"bf85f6d3-9313-4d5c-9dff-88dffc891119","resolution":{"observed_at":"2026-08-07T14:58:56.363483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04693","last_updated":"2023-11-08T14:02:53Z","snapshot_observed_at":"2026-08-04T07:43:21.606101Z","submitted_at":"2023-11-08T14:02:53Z","title":"Diff-HierVC: Diffusion-based Hierarchical Voice Conversion with Robust Pitch Generation and Masked Prior for Zero-shot Speaker Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04693","snapshot_observed_at":"2026-08-07T14:58:56.506395Z","title":"Preprint, arXiv:2311.04693","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.506395Z"},"links":{"cited_paper":"/paper/2311.04693","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:f685ca89355b0155eaf11a3c37b2cc079af7ccd368b27fe6d97555e3eaabcc6d","observation_id":"13a8820e-17dd-4d1a-95bf-a9e3cef8c4c1","resolution":{"observed_at":"2026-08-07T14:58:56.506395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-07T14:58:56.651626Z","title":"Preprint, arXiv:2308.11596","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.651626Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:e22c1a9f38720a853c4b568bd513b98a112ee1415d203e47e39b48eae5afd801","observation_id":"1adbc139-7c13-48a6-839f-2e209a6be972","resolution":{"observed_at":"2026-08-07T14:58:56.651626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-07T14:58:56.747744Z","title":"arXiv preprint arXiv:2005.07143","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.747744Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:2e527e040ff5edbb3d0dfaf3d9786186cf4482b09a3d0d9dda603a67a53f964e","observation_id":"5ad2fdbb-073f-4f29-a04d-568c9628d2a4","resolution":{"observed_at":"2026-08-07T14:58:56.747744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-07T14:58:57.060521Z","title":"Preprint, arXiv:2206.04658","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.060521Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:bbbb8a41981a9e88925625280e08441b603f5db147f5c53846735ff0ac9a5125","observation_id":"e23d19c3-e4d0-4c5b-9b03-a0f3341ab500","resolution":{"observed_at":"2026-08-07T14:58:57.060521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-07T14:58:57.464868Z","title":"Preprint, arXiv:2306.15687","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.464868Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:fb87726b06626f1a4103d9c754f8338fed051201590d51435385dae141e24a4b","observation_id":"228b822e-6e8d-4a88-ad92-ce19c9c4def3","resolution":{"observed_at":"2026-08-07T14:58:57.464868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08676","last_updated":"2024-01-30T14:11:29Z","snapshot_observed_at":"2026-08-07T15:23:20.538497Z","submitted_at":"2023-12-14T06:26:55Z","title":"SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention","version":2},"cited_work":{"arxiv_id":"2312.08676","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.08676","snapshot_observed_at":"2026-08-07T14:58:58.996725Z","title":"SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention","venue":"cs.SD","work_id":"0fe684a8-aaf3-4707-939f-daddce5a85b2","year":2023},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.566166Z"},"links":{"cited_paper":"/paper/2312.08676","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:7fddd1ef2eee763765ac4572f7b908ecbc1df86462b130e4b6bdc9820687c86f","observation_id":"1c534e74-3d06-4aae-92a9-1ff10d953b22","resolution":{"observed_at":"2026-08-07T14:58:59.160738Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-06T16:37:49.547342Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-07T14:58:57.726231Z","title":"Preprint, arXiv:2411.09943","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.726231Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:d48fe664aed87fb4409d0b63ade868affc1fd03a162f5eec6d40c2a6a96a0917","observation_id":"0b9c0f93-9ca5-4759-9b6e-400d1b5d827d","resolution":{"observed_at":"2026-08-07T14:58:57.726231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:59.909131Z","title":"In ICASSP 2024-2024 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 13326–13330","venue":null,"work_id":"9cb04453-c60f-4030-b6cb-bde40947acd9","year":2024},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.886020Z"},"links":{"citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:0acfa502c7117309fc26198febcec584610aea0d954da69b39cda85406fc1f78","observation_id":"b0bae56f-0cdf-4a18-b815-56dfb596753d","resolution":{"observed_at":"2026-08-07T14:59:00.048756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-07T17:24:03.888611Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-07T14:58:57.976936Z","title":"Preprint, arXiv:2109.13821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.976936Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:7091864c153755bf7cc0f55ccfe2e4a7411a7f397d5973a7940a02b0eb92f269","observation_id":"47aa4c1a-aabe-44ef-9e16-7d104fc9573b","resolution":{"observed_at":"2026-08-07T14:58:57.976936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T14:58:58.106744Z","title":"Changhan Wang, Morgane Rivière, Ann Lee, Anne Wu, Chaitanya Talnikar, Daniel Haziza, Mary Williamson, Juan Pino, and Emmanuel Dupoux","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.106744Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:85ed415997db6b7092a096575a4e78b6f52f51d72a94fc973c910329192ae39a","observation_id":"e4d833d4-08ac-4fa7-8743-bdc62c644824","resolution":{"observed_at":"2026-08-07T14:58:58.106744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T14:58:58.237399Z","title":"Preprint, arXiv:2101.00390","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.237399Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:3792b2bc65f58420d8130907adb618eb9722b2adac721646305cf3485883005d","observation_id":"ee506292-b81c-45b4-8312-f35493fea5df","resolution":{"observed_at":"2026-08-07T14:58:58.237399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-07T11:14:08.982821Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-07T14:58:58.358652Z","title":"Preprint, arXiv:2412.04724","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.358652Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:01ccf2d57197dd8b738b39ed647aed761d6fe8bf490d62ab116bf7876b0ba9d3","observation_id":"493a615c-a7b9-4057-bea5-f2569222ea15","resolution":{"observed_at":"2026-08-07T14:58:58.358652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05471","snapshot_observed_at":"2026-08-07T14:58:58.610208Z","title":"Preprint, arXiv:2502.05471","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.610208Z"},"links":{"cited_paper":"/paper/2502.05471","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:8b00a00e157e73e93092133c54b4ca5d61478654ab6862a0b5f0cbb908cabf3b","observation_id":"74f6896e-0381-4b69-8a07-941b1548c3bc","resolution":{"observed_at":"2026-08-07T14:58:58.610208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T14:58:58.472965Z","title":"Preprint, arXiv:1904.02882","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.472965Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:374eef9bb46f5e5165d0b0493e8d1f3153faf443b17b5165aa1fd3d2688283df","observation_id":"495d6f42-2df5-42fd-a52b-50529f4c5772","resolution":{"observed_at":"2026-08-07T14:58:58.472965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:58:55.919987Z","title":"Preprint, arXiv:1912.06670","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:55.919987Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:c7dc6c948de6cc0b72760bdbad5c6e5665614aa787479a49b11f1c3b79a324ab","observation_id":"49016cc0-d922-442c-819a-db771d2bb707","resolution":{"observed_at":"2026-08-07T14:58:55.919987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-08T09:38:45.288574Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-07T14:58:57.191969Z","title":"Preprint, arXiv:2106.07447","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.191969Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:7757a4541e1515ed94189e96bb5acfb2f2115635941254ea0496588d7eecb72c","observation_id":"3efc365d-704a-4714-8d27-54e70b726133","resolution":{"observed_at":"2026-08-07T14:58:57.191969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12666","last_updated":"2022-08-26T13:37:45Z","snapshot_observed_at":"2026-07-06T13:45:49.712149Z","submitted_at":"2022-08-26T13:37:45Z","title":"Effectiveness of Mining Audio and Text Pairs from Public Data for Improving ASR Systems for Low-Resource Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12666","snapshot_observed_at":"2026-08-07T14:58:56.149069Z","title":"Preprint, arXiv:2208.12666","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.149069Z"},"links":{"cited_paper":"/paper/2208.12666","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:828baa476f5b5cc10135d59746716326be40b95a547247eebcdd2c6cf15c2c31","observation_id":"8ffef98b-e581-4b4d-b210-3f777faee46b","resolution":{"observed_at":"2026-08-07T14:58:56.149069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18975","last_updated":"2023-05-30T12:19:07Z","snapshot_observed_at":"2026-07-06T15:35:22.185803Z","submitted_at":"2023-05-30T12:19:07Z","title":"Voice Conversion With Just Nearest Neighbors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18975","snapshot_observed_at":"2026-08-07T14:58:56.015567Z","title":"Preprint, arXiv:2305.18975","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.015567Z"},"links":{"cited_paper":"/paper/2305.18975","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:79c74190bf50f089c718029c11c649fcf86ffc5807c57b1fa8ff3ab299acb14e","observation_id":"ba9d2b6d-03b8-49d0-ad90-c6c82a1dff5c","resolution":{"observed_at":"2026-08-07T14:58:56.015567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-07T14:58:56.891964Z","title":"Preprint, arXiv:2406.18009","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.891964Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:a655055b2b11aed5b3f69e7d4f205c1af67274ec2fc1af72d85b3ed9729e9b42","observation_id":"56111811-5b5e-4c57-af0d-eb834e641a8d","resolution":{"observed_at":"2026-08-07T14:58:56.891964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-07-06T20:15:49.954077Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"cited_work":{"arxiv_id":"2501.01347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01347","snapshot_observed_at":"2026-08-07T14:58:59.365883Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","venue":"cs.SD","work_id":"8cf20ece-cad0-43e4-a364-1fc9c1dac78f","year":2025},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.316479Z"},"links":{"cited_paper":"/paper/2501.01347","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:4ecf469857f3a75535ede5f31cfbcf8eb3cea74194e5410943398e1fa257c2f2","observation_id":"27f11978-8d2c-4b53-bb74-d756d3c3387b","resolution":{"observed_at":"2026-08-07T14:58:59.436990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2505.16691."}