{"as_of":"2026-08-09T18:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5467db8ae9052bc5bea4d2b3b46fb230e64d334099b2b7b8810bacde27a90c8e","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:26:19.369265Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:21:59.575812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:39:38.691071Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-08-06T23:21:59.575812Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.575812Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:946f118541a22a22726a8d092165d6264c2cd24d19e35b7263b93e8725c3ae6f","observation_id":"abde2652-5844-45b5-bc1b-6b14c8aafb41","resolution":{"observed_at":"2026-08-06T23:21:59.575812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-08-05T13:36:07.305867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.305867Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:3b9010613a8acfeb63eb653b727f22d251070ba1ce27d9730e200f04548cccf0","observation_id":"64546f18-8417-4c2a-b48b-0557f261eb3f","resolution":{"observed_at":"2026-08-05T13:36:07.305867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":"2502.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-07-04T07:39:38.691071Z","title":"Semantic Distill","venue":null,"work_id":"ce2ef5e3-64bf-4fa4-9142-79398e23a22c","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:19c4d42217ce41375879899ab1f162067fd51b74e90afa1781230cee1f2c0da6","observation_id":"80a7b18a-b5da-4ab4-997e-a3a9b98d8558","resolution":{"observed_at":"2026-05-10T23:50:51.780513Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":"2502.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-07-04T07:39:38.691071Z","title":"Semantic Distill","venue":null,"work_id":"ce2ef5e3-64bf-4fa4-9142-79398e23a22c","year":2025},"citing_paper":{"arxiv_id":"2604.11552","last_updated":"2026-04-19T12:57:45Z","snapshot_observed_at":"2026-08-02T16:35:17.072464Z","submitted_at":"2026-04-13T14:40:25Z","title":"MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T14:57:07.894455Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2604.11552"},"observation_digest":"sha256:bd6c6dd36cee492a05703aa3b27256128470673985534e90aeaef46ad7dea7bf","observation_id":"148ee6a2-99f8-4893-a50c-40d16a870387","resolution":{"observed_at":"2026-05-11T11:26:01.383468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":"2502.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-07-04T07:39:38.691071Z","title":"Semantic Distill","venue":null,"work_id":"ce2ef5e3-64bf-4fa4-9142-79398e23a22c","year":2025},"citing_paper":{"arxiv_id":"2606.21343","last_updated":"2026-06-19T11:41:30Z","snapshot_observed_at":"2026-07-30T09:03:07.020192Z","submitted_at":"2026-06-19T11:41:30Z","title":"An Evaluation Framework for Text-to-Speech Voice Reconstruction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T13:16:05.358573Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2606.21343"},"observation_digest":"sha256:bb61e528e734526838bc8f7825bf08b7f4f263872a5546ca213c16f8874cc548","observation_id":"aef88493-6709-4379-9fe4-f2919aaf5837","resolution":{"observed_at":"2026-07-04T07:39:38.692633Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":"2502.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-07-04T07:39:38.691071Z","title":"Semantic Distill","venue":null,"work_id":"ce2ef5e3-64bf-4fa4-9142-79398e23a22c","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:52158c45e792c5b1720c8513474a3632018fbdf95b335c9fddbcfd74d6f3ef4b","observation_id":"6c019909-a819-4aef-b337-348e77d88fbb","resolution":{"observed_at":"2026-07-01T11:45:47.092101Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-07-11T22:31:42.563915Z","title":"Vevo: Controllable zero-shot voice imitation with self- supervised disentanglement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03985","last_updated":"2026-07-04T19:05:37Z","snapshot_observed_at":"2026-08-07T15:23:22.762808Z","submitted_at":"2026-07-04T19:05:37Z","title":"NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T22:31:42.563915Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2607.03985"},"observation_digest":"sha256:94fc052ce69ebbaf007e422620cab9f2e70b55cb1a80912fde6fd23b5a5e0685","observation_id":"cffc3372-92ee-43d3-99f7-c5a05a951d70","resolution":{"observed_at":"2026-07-11T22:31:42.563915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07243/citation-record","integrity":"/paper/2502.07243/integrity","json":"/paper/2502.07243/citation-record.json","paper":"/paper/2502.07243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.088321Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.088321Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:bc74e8b1a753c6eafd8f715ae8c5852914a578f70b88a523713b6101c756cb69","observation_id":"1234a951-ef09-4289-a4bb-218485f1202d","resolution":{"observed_at":"2026-08-08T13:26:19.088321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.092101Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.092101Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:a8db9b2864e8c3e304a920fe11c6ad378e2712f59457772c596b9a3cbd86a536","observation_id":"9621dbf3-776a-4578-87e4-6d5cc7130f2d","resolution":{"observed_at":"2026-08-08T13:26:19.092101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.095768Z","title":"An overview of voice conversion systems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.095768Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:e19f6b30880661a46ae725fa8f8279d1f44da4de4c6c229d2ca341175a9aac49","observation_id":"cdcc9f2f-cdc6-46b8-8c46-646cb2c70740","resolution":{"observed_at":"2026-08-08T13:26:19.095768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.099143Z","title":"An overview of voice con- version and its challenges: From statistical modeling to deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.099143Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:bfecaef24b179fb5852c4d115e79b69cd3ab154ff69ed092e8d02093cb087289","observation_id":"c384d50e-393a-4c38-9e76-05d4c1c59737","resolution":{"observed_at":"2026-08-08T13:26:19.099143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.102330Z","title":"Foreign accent conversion in computer assisted pronunciation training","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.102330Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:ae24414368f848eb4e8cbf56919dd0c46754244df21bf039f8e900a49d237ae7","observation_id":"2ef66d9b-3efe-4cc5-9fdb-32a19f32fb3b","resolution":{"observed_at":"2026-08-08T13:26:19.102330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.105470Z","title":"L2-ARCTIC: A non-native english speech corpus","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.105470Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:659ab8785a9f9c761f21a92a624ed25f5738bf73809c0bc87bc64ba4b880e5a9","observation_id":"9f2d5106-5bcc-4539-92f2-5c08a4174d82","resolution":{"observed_at":"2026-08-08T13:26:19.105470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.108882Z","title":"Emotional voice conversion: Theory, databases and ESD","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.108882Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:bcdf43d37d406a9bed0ddf3258056874f73f62d96e69c5b38b4f6718a8773b71","observation_id":"84010b50-fc81-409d-b51c-3e124781da88","resolution":{"observed_at":"2026-08-08T13:26:19.108882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.112021Z","title":"Neural Text-to-Speech Synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.112021Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:39bbe6af22dae263ce6ca2393b0c6f94f47cdc3d42c89dcba3374fa23b27c93e","observation_id":"8f4141dd-7b92-4bc3-a3ed-6c8dade41c33","resolution":{"observed_at":"2026-08-08T13:26:19.112021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.114754Z","title":"Converting foreign accent speech without a reference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.114754Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:4ce9c5ad99ec5b3bbd4f617f345cee585b6f954d61a22b78e36de9efdb4eaf1a","observation_id":"bbf8051d-f030-4f39-8e3f-6990403e10e7","resolution":{"observed_at":"2026-08-08T13:26:19.114754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.117635Z","title":"Sahidullah, Aur ´elien Bellet, Marc Tom- masi, and Emmanuel Vincent","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.117635Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:4602060dd4f9eb7a260b6124955307d197d9d638a4f68dc74ef788d268978404","observation_id":"b5ddc4a1-f58f-452b-9dab-64b5718a6ba1","resolution":{"observed_at":"2026-08-08T13:26:19.117635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-08T13:26:19.120659Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.120659Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:3221286dd3c35bdb05c6cfc5f7bcf9d0c5aa02b1b63d15f1eb2f0b25298da14c","observation_id":"05a4d2f1-477d-49e4-9574-6aa2484f14a0","resolution":{"observed_at":"2026-08-08T13:26:19.120659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-08T13:26:19.124096Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.124096Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:e287484e547dda8ebad352bfc0ca1dd55707107599892febaf4cd0586bc6e834","observation_id":"ab9f82f4-1ab7-4ad4-82d3-3aab0706d44f","resolution":{"observed_at":"2026-08-08T13:26:19.124096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.127638Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.127638Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:a6bbc353a12a280c9dcf49de3635c1479b60aa3d1a6808e393469e9f9d50f44c","observation_id":"11b705f3-918e-4255-a214-222525ab2f0e","resolution":{"observed_at":"2026-08-08T13:26:19.127638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.130748Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.130748Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:25975864563580a438a597fce7040d32f51983fdb3b728c954e758d7f23e3cef","observation_id":"07ff5752-9eaa-4c8d-a501-508a918d48fe","resolution":{"observed_at":"2026-08-08T13:26:19.130748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.133715Z","title":"Speech resynthesis from discrete disentan- gled self-supervised representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.133715Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:8e9622415424204bcccbcd397040a227d9b6bf0472ada412769a7c62705b1fcf","observation_id":"6a2d694b-e80e-42a1-9d7c-b13db2eb9f4b","resolution":{"observed_at":"2026-08-08T13:26:19.133715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-08T13:26:19.136859Z","title":"Mega-tts: Zero-shot text-to- speech at scale with intrinsic inductive bias","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.136859Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:65a417afdf6fd71ecf67d9e488eb1e16b44e14f6100074d5d3216058a49c3560","observation_id":"6e9e5b21-1953-45c9-9c85-9baf1e1642fb","resolution":{"observed_at":"2026-08-08T13:26:19.136859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.140473Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.140473Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:9e814a35b62d14c3725adb4562b48e5f52ce731ce175511761ba06b61f06bf63","observation_id":"53b580d5-50d5-4831-b8b8-aab0451b14bc","resolution":{"observed_at":"2026-08-08T13:26:19.140473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:20.021192Z","title":null,"venue":null,"work_id":"2ff77a36-1c29-4c77-8c35-5173599d5a1b","year":2015},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.143740Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:ed6e7b3215a6dd7e8fc034ede544fd035d583f3c8689d7da23fc96734e0a8db9","observation_id":"48cc366c-9511-4c1d-b45c-122c4c30fd9f","resolution":{"observed_at":"2026-08-08T13:26:20.024364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:20.012495Z","title":"Deep bidirectional LSTM modeling of timbre and prosody for emotional voice conversion","venue":null,"work_id":"5da6ddb4-fe59-4061-b46a-4ae73178624d","year":2016},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.146950Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:5f5f58da09b092c1435471ee50ff821d1afeefa77230b8e3123288450c3bf310","observation_id":"b16bd86c-730f-47cb-a719-d59fc2465f63","resolution":{"observed_at":"2026-08-08T13:26:20.015767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06674","last_updated":"2024-04-11T17:52:15Z","snapshot_observed_at":"2026-08-09T00:10:20.232518Z","submitted_at":"2024-04-10T01:33:08Z","title":"VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06674","snapshot_observed_at":"2026-08-08T13:26:19.150092Z","title":"V oiceshop: A unified speech-to-speech framework for identity-preserving zero-shot voice editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.150092Z"},"links":{"cited_paper":"/paper/2404.06674","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:fb81d015a88b168c67fa21b828e10a58e8b3a396264b78a922dd5973260a6c4c","observation_id":"b4e0abf5-deb8-4310-a6aa-de5bb23ebfa5","resolution":{"observed_at":"2026-08-08T13:26:19.150092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:20.003681Z","title":"Convert and speak: Zero-shot accent conversion with minimum supervision","venue":null,"work_id":"8c558ba5-14fa-4564-b155-988328435b9a","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.153241Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:3db39b7f67e5b0cec27d048052cb766110f68412468d44039994fc8b22c027e2","observation_id":"6e1cff98-0b03-451c-8ab3-a3b8d7261506","resolution":{"observed_at":"2026-08-08T13:26:20.006904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.994845Z","title":"Au- tovc: Zero-shot voice style transfer with only autoencoder loss","venue":null,"work_id":"b74e710b-16d4-4964-bff1-e7b1bcbb3382","year":2019},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.156236Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:139baf4f5a440c7e2b32b2e738728a85aae6eb889a306483954cb11fce75cec5","observation_id":"d63fbd8f-c1e4-4798-99a1-4a417dabffc5","resolution":{"observed_at":"2026-08-08T13:26:19.998020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-08T13:26:19.158875Z","title":"BASE TTS: lessons from building a billion- parameter text-to-speech model on 100k hours of data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.158875Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:94b92c2c01dd13910e075767aeb5402eb106a3f25300766953e38f3439b2903e","observation_id":"be8810d0-db54-481e-abb2-683a25f231af","resolution":{"observed_at":"2026-08-08T13:26:19.158875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-08T13:26:19.162381Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.162381Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:df82bd587f03672fb17471562624e28fc27bc17fea02523c8d97ab4a32561c3c","observation_id":"712c1ffd-5225-45d3-bd18-6aba84d44a47","resolution":{"observed_at":"2026-08-08T13:26:19.162381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-08T13:26:19.165401Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.165401Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:1423561de31df12e1209750d0a200e7bb98ddcd46d9b4940d3bf9ee0850a1437","observation_id":"54dc202b-f995-44b5-9425-fc2300fe4d46","resolution":{"observed_at":"2026-08-08T13:26:19.165401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-08T13:26:19.168802Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.168802Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:002838c1af1969d4b753b7590c51933eeb1caf12b8591b7c9f107a506f38c6bc","observation_id":"8dd7fa07-0c42-4fbc-9577-7def92b7ad11","resolution":{"observed_at":"2026-08-08T13:26:19.168802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.172375Z","title":"V oicebox: Text- guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.172375Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:c78b9d02e903ef309ff4c31b68fdc4e04f821ff490b5225ffad6aa97b4383af3","observation_id":"9bf9cba5-4724-401d-84a2-5dc3a569a6c9","resolution":{"observed_at":"2026-08-08T13:26:19.172375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.981199Z","title":null,"venue":null,"work_id":"b2659f34-e8fe-4ab0-a1e4-fe1814164dea","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.175536Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:60bf0b1a3f42700f6e1f65bae2156a053e65a67da0d2c9e27a93855b23d5db66","observation_id":"8fc2728d-5e2a-48df-ab02-34693677b7c2","resolution":{"observed_at":"2026-08-08T13:26:19.984343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.972263Z","title":"V oice- preserving zero-shot multiple accent conversion","venue":null,"work_id":"edde5448-d069-4a16-a1b5-f403c1375759","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.178687Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:06816b63c466015b9d539bea8b87ad8304aed09e2f7cda3b7ad336a6f11b6ef7","observation_id":"ff1696aa-260f-49fe-be8d-3e0e641aa098","resolution":{"observed_at":"2026-08-08T13:26:19.975383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.963809Z","title":"Schuller, and Haizhou Li","venue":null,"work_id":"8c976cc4-31c9-486b-b6c8-94e6bbbcfed4","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.181727Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:2a5cca11947dd0446149d0894d43b7bc0f1395fb7fb194b471d20935c60cff7e","observation_id":"9d8b0e25-1f48-424f-a484-258480a55ff0","resolution":{"observed_at":"2026-08-08T13:26:19.966785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.954813Z","title":"PA VITS: exploring prosody-aware VITS for end-to-end emotional voice conversion","venue":null,"work_id":"2c3cee52-a66e-4b01-a619-3aed64f6dc33","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.184577Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:802e7fc59e6babf3c83f10e2cc305df44c51e527a49bc833485d47d248573a6e","observation_id":"e4bf249b-c83e-41c0-bb00-de4227ca1539","resolution":{"observed_at":"2026-08-08T13:26:19.958284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.945300Z","title":"Transfer the linguistic representa- tions from TTS to accent conversion with non-parallel data","venue":null,"work_id":"eec50a64-7f36-4738-a5f0-0f7423749faf","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.187544Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:43c8393683d82f7d463a39031df26535b40cbf0c1be52d2a542bfa421a60a4f1","observation_id":"cb915b3c-08b9-4090-8a15-d8a50bf05a15","resolution":{"observed_at":"2026-08-08T13:26:19.949309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.936318Z","title":"U-style: Cascading u-nets with multi-level speaker and style modeling for zero-shot voice cloning","venue":null,"work_id":"e75d5dab-ad1a-49ea-a44c-a3ee288bd7df","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.190541Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:6bc85a0d292d4ddcf41e36681fcf1865788b63779d55888f0d025e591fb28212","observation_id":"a52ec863-cd90-4e3b-97da-87c94d9798dc","resolution":{"observed_at":"2026-08-08T13:26:19.939715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.193725Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.193725Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:740d50492cab30091232ddfaabe04eafac9e4cd857a40c75743acfbb494e899b","observation_id":"32c230e2-b170-4780-855b-e79bba4ccccb","resolution":{"observed_at":"2026-08-08T13:26:19.193725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T13:26:19.196997Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.196997Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:9863627c22568f6093d8319b02a4fe981d703ed03b91dad06bdcbbdb8bcb13e6","observation_id":"6baec9ef-0a8b-435f-909f-835a1966cab0","resolution":{"observed_at":"2026-08-08T13:26:19.196997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.200113Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.200113Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:ca1dd70af696ff09863891c7180990c2c3fc5e995b9411803ea5431dc671a5bc","observation_id":"ffb292e5-e1b2-4a92-b961-b30131fcd04a","resolution":{"observed_at":"2026-08-08T13:26:19.200113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.917729Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"948aa9bd-25c0-40b5-aabf-8b81a0f30822","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.202942Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:dd13311bda61ba9e030120455830e5a224d6c0b01551b0a4d5170342723a3677","observation_id":"f59cd892-b39e-4fb8-b11f-f5882fcac97e","resolution":{"observed_at":"2026-08-08T13:26:19.920850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T13:26:19.205829Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.205829Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:07e69173bfabe1b7825373eb03d46529f9880199fa47a5b4f0c7425abe6a9b3b","observation_id":"f9b274d1-daa9-4b5a-85f6-5411061b25d3","resolution":{"observed_at":"2026-08-08T13:26:19.205829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.909052Z","title":"One-shot voice conversion by vector quantization","venue":null,"work_id":"45b7ac6d-bdd8-40ca-a9da-bec516e5e41f","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.209096Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:e0d185e7aa77e7e7d56aa85e67bfcd7aab77c671cb8489dc12d6de5a4a0007a9","observation_id":"02e7d8be-5b9d-4760-aba5-1cb3debb871c","resolution":{"observed_at":"2026-08-08T13:26:19.912239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.900926Z","title":"Unsupervised learning of disentangled speech content and style representation","venue":null,"work_id":"ab0955ab-a442-4077-9ad6-d3e055ff5d40","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.211965Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:a541570df1041f233373dd74f7690e53fc0052feb40b87bf430594416f4a9f93","observation_id":"fff07ec3-4590-4663-93c6-cc10cca13954","resolution":{"observed_at":"2026-08-08T13:26:19.903838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.893058Z","title":"Text- less speech-to-speech translation on real data","venue":null,"work_id":"518d717c-f673-4673-82fc-2edc379cd59d","year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.215144Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:67044e2751e52ed1dfbeecb719b32858a4c1a239afbe70fae4c2758ec2937f17","observation_id":"0b2c7c32-6e36-488c-843a-6e54cf7b2674","resolution":{"observed_at":"2026-08-08T13:26:19.895972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.885509Z","title":null,"venue":null,"work_id":"68773cc2-c1c8-4a1b-83c9-fcec3d7c2226","year":2016},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.218507Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:a6ded04c91b98abc9d979fba7a1ce07246e9ab81c192b596790c9abc65a81ff6","observation_id":"f2dd42d1-ebc7-41b9-9bc5-b15b453909e6","resolution":{"observed_at":"2026-08-08T13:26:19.888168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.877658Z","title":"A comparative study of self-supervised speech representation based voice conversion","venue":null,"work_id":"046c05ac-52b7-42e9-80ef-2f5cb092e17a","year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.221950Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:0075c70191aeefc633c6a2f0d63523fa832fde04ea70d42b1da49b80a1ef8a17","observation_id":"cce790f6-3be1-4ef6-8e45-4148352c4a91","resolution":{"observed_at":"2026-08-08T13:26:19.880694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.869390Z","title":"Leveraging diverse semantic-based audio pretrained models for singing voice conversion","venue":null,"work_id":"7548143c-8611-42d7-a39a-14a676d74ce7","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.225095Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:e65671e9e8d7e9f93049f98deb244d2bbd68944bdd48a9e3e7969792d53b0f8d","observation_id":"7e0f126a-39a0-4447-90e0-55372264de06","resolution":{"observed_at":"2026-08-08T13:26:19.872428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.861057Z","title":"Cyclegan-vc: Non-parallel voice conversion using cycle-consistent adversarial networks","venue":null,"work_id":"18e5716f-0935-48f8-938d-29c49aa7de13","year":2018},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.228370Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:0136c842b76da459643eeaf63f9c38f8b9fc680d53b25c0d0d07c0bbbcfbc9fa","observation_id":"c6debe6e-8d3c-4c3c-9386-b7b172cb9bbb","resolution":{"observed_at":"2026-08-08T13:26:19.864166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.852718Z","title":"Stargan-vc: non- parallel many-to-many voice conversion using star generative adversarial networks","venue":null,"work_id":"0600714f-1336-4b14-9e47-c4ee502b2e1a","year":2018},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.231460Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:f48faf07e34bfd2b68f34f7471930f5f225b9c7f5fd5c8441503aa5118bb79df","observation_id":"b21ccbbb-9ffe-4d95-b1a1-946d7527d093","resolution":{"observed_at":"2026-08-08T13:26:19.855792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.844448Z","title":"Diffusion-based voice conversion with fast maximum likelihood sam- pling scheme","venue":null,"work_id":"29114e14-0741-4f2c-9b1b-8924232d939c","year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.234763Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:d063c9e8ac9bda816df38521025b0394b745b1d39202f9baaf01a3fb62362404","observation_id":"7ade7335-7583-48a0-bb39-d1564a094f0a","resolution":{"observed_at":"2026-08-08T13:26:19.847440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.836061Z","title":"Diff-hiervc: Diffusion-based hierar- chical voice conversion with robust pitch generation and masked prior for zero-shot speaker adaptation","venue":null,"work_id":"fd1f665b-fb43-4802-9d74-0947a9302be1","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.238179Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:3320e737672b996d096a64a17dd86b1882380b7c25d4972e749457308ebf06a9","observation_id":"e579a085-1702-4f69-8e7a-d3a41f7d7b54","resolution":{"observed_at":"2026-08-08T13:26:19.839236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.827800Z","title":"Tts-guided training for accent conversion without parallel data","venue":null,"work_id":"d616fd8e-0468-4918-81a1-8e1381f7bcfb","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.241259Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:9875003a1eb7129a9b1f4a5a28b79e1dca99c55389031bdda99964e0a6b1e1aa","observation_id":"0117c55c-388b-4907-b30b-5a76b2feb2ed","resolution":{"observed_at":"2026-08-08T13:26:19.830985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.819733Z","title":"End-to-end accent conversion without using native utterances","venue":null,"work_id":"2c813f8c-1bfb-4c7a-b16b-6b2ea1374148","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.244394Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:6ba7604f7012f12230d70e9918a99489971091eca180a0ae6c6009bbcc9f45f0","observation_id":"efd90fa0-40a8-41eb-84b7-b3095e3c6b4f","resolution":{"observed_at":"2026-08-08T13:26:19.822725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.811515Z","title":"Non-parallel sequence-to-sequence voice conversion with disentangled linguistic and speaker representations","venue":null,"work_id":"7250034e-954a-4bcd-bdff-9c782c8e0dba","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.247887Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:27dc467dfe347974f0f7a2b44e231c3b32b37267e5704e1ccee8c56a62193844","observation_id":"2333a5bb-d67a-49cb-a334-c7bb3dee15cc","resolution":{"observed_at":"2026-08-08T13:26:19.814630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.802888Z","title":"LM-VC: zero-shot voice conversion via speech generation based on language models.IEEE Signal Process","venue":null,"work_id":"4f5e1084-7a9e-4eb8-a8da-6793058d9253","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.251307Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:bb45e4076a2cd3f426c0d77198ef21c6a5d2a20ded7dd765e7705cad35346a36","observation_id":"e933a787-f410-4603-b343-601a48a25b3f","resolution":{"observed_at":"2026-08-08T13:26:19.806051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-08T13:26:19.254583Z","title":"Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical vari- ational inference for zero-shot speech synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.254583Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:95c220c0f063eb8ab40cfc00e030bd98a70a9e550c5e46e6f626d470760dbb22","observation_id":"49e1554d-4460-4704-a07a-acb5915ffb54","resolution":{"observed_at":"2026-08-08T13:26:19.254583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.794583Z","title":"A comparison of discrete and soft speech units for improved voice conversion","venue":null,"work_id":"dd431d8d-9ade-42bf-ba03-79802e9325c9","year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.258005Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:0e27ae0d269e8eabbc9788ec5d27b1f02d8ff9f17f1ca40ad90b41add2056e96","observation_id":"616a3740-187f-4e40-9ae3-7ad81e2b7bca","resolution":{"observed_at":"2026-08-08T13:26:19.797639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.787070Z","title":"SEF-VC: speaker embedding free zero-shot voice conversion with cross attention","venue":null,"work_id":"00a6dc25-56eb-4c5c-8da1-77bdaa8cd776","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.260858Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:6df34fb5dc5829b93ea18eec0f8990085d443723af49ddbdf2ca4c07e10ba5e2","observation_id":"7f46fa70-3f63-4b79-80e6-1882ea7259c6","resolution":{"observed_at":"2026-08-08T13:26:19.789762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.779422Z","title":"Neu- ral analysis and synthesis: Reconstructing speech from self-supervised representations","venue":null,"work_id":"39924b65-7782-4b2d-ad1a-7ddfa7f4b6a2","year":2021},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.263434Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:46f2b4320c7bda05e387688559abea06144cea85763f4e687470068cc51bcfe0","observation_id":"019df985-128f-4a50-9923-fc61b67370ae","resolution":{"observed_at":"2026-08-08T13:26:19.782063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.771513Z","title":"NANSY++: unified voice synthesis with neural analysis and synthesis","venue":null,"work_id":"5b30b809-9968-4aeb-8286-88698b27ecdd","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.265980Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:27b2e574d3b47a4210801d1bba56f8be51527bf7b80c97f1deaee532895565f2","observation_id":"8d86c200-b042-4825-9fd0-b3f4f953501e","resolution":{"observed_at":"2026-08-08T13:26:19.774318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.762766Z","title":"Speechsplit2.0: Unsupervised speech disentanglement for voice conversion without tuning autoencoder bottle- necks","venue":null,"work_id":"ed3d929e-7009-4fe9-b003-5d915ed15d2f","year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.268522Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:4366479072740ddd44c6826a97b77a3bc63e71297ab47e0afaff16aa4c384728","observation_id":"def82cc8-225b-4949-9917-0a981577767f","resolution":{"observed_at":"2026-08-08T13:26:19.766187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.754159Z","title":"Cox, Mark Hasegawa-Johnson, and Shiyu Chang","venue":null,"work_id":"8c64ac7b-8d8c-485a-a158-78f7ef945e45","year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.271441Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:7b4d1107134c8264915732282d08de3e61cbc99bf7884c11ec1918a071bb9e19","observation_id":"f0e34687-921c-4eed-87e3-61b6123eb262","resolution":{"observed_at":"2026-08-08T13:26:19.757329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.745609Z","title":"Multi-speaker expressive speech synthesis via multiple factors decoupling","venue":null,"work_id":"04986bca-3a69-4ccd-9c75-f6ef9593fa8f","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.274184Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:aacc9daee333f58e10e664a23cddfeff48245ba5fc0d406d41c628f9fb63ba59","observation_id":"e0381617-1b1b-4451-9a2e-b8ba001f3301","resolution":{"observed_at":"2026-08-08T13:26:19.748797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.736771Z","title":"CLUB: A contrastive log-ratio upper bound of mutual information","venue":null,"work_id":"f45ca7b3-9391-45e9-b1e1-ab29efc8e5c9","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.276826Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:0bcd025ec652c1d281a370a809e717ac1b33a26b89ffa2d5214373aa962a60c2","observation_id":"efdb67c7-5795-43ff-878b-ab42b2040bc5","resolution":{"observed_at":"2026-08-08T13:26:19.739916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.728132Z","title":"Repcodec: A speech representation codec for speech tokenization","venue":null,"work_id":"f071633b-a971-48c5-a8ae-a39a4b76c1e4","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.279359Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:b62efc8882516ad9a52ab7093f4c0948b1914652795bb72c8a227121a116d9ff","observation_id":"44448173-2d8b-4098-ae9b-fd6b8fe82fd4","resolution":{"observed_at":"2026-08-08T13:26:19.731258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.281773Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.281773Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:47eae18f35d71706d1c12c5ed03847fa41c20d3b5f79a64266e5a4dd7c3dd246","observation_id":"ee6f654c-e8bf-43d3-92ba-67f5aa894cb3","resolution":{"observed_at":"2026-08-08T13:26:19.281773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.714688Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing","venue":null,"work_id":"b7b63518-c05f-4e29-acf7-ad2a03cfce4f","year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.284565Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:9f8a250ed75010d75231b17a58f2a62cbb8a498558e08d8b2408d21ca7195ed4","observation_id":"3a7660a3-b4de-4b7a-852e-2f8cbe5b0437","resolution":{"observed_at":"2026-08-08T13:26:19.717869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.706047Z","title":"ECAPA-TDNN: emphasized channel attention, propagation and aggregation in TDNN based speaker verification","venue":null,"work_id":"34ee7566-38fe-4055-b764-ec4bb9f687fb","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.287428Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:9889df8623d922d5f7487ae26aa7dd3034d70aa1c9ce16db59e641e901f01c3e","observation_id":"04a83850-4d53-4914-b52d-5c58321399a7","resolution":{"observed_at":"2026-08-08T13:26:19.709198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.697141Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"e40b8b2c-dd2f-4b4f-af5a-3a83c607e9bd","year":null},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.290292Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:c93e712e433c4eb65052db3d5f0f24ce9a0c3105d043b719ed5b96df3398e63e","observation_id":"cb1b2cf2-77a4-4c63-8175-dbb8f8527d1a","resolution":{"observed_at":"2026-08-08T13:26:19.700442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.684110Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"8203f845-dcf6-4df4-9076-c3aaf94cbda5","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.296292Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:f6d43e91f9f77e8d91e80420bbae3c7a1a791c11e9a4108ba28641a466a7749b","observation_id":"1caf02e0-b17b-4418-ab8a-847aa87da851","resolution":{"observed_at":"2026-08-08T13:26:19.687235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.676041Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":"35cf5816-9dcf-4112-8ae3-986b7f337a3e","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.299049Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:d51194da8d1d4ff4f0d4f68db6702ec79196a0053289ce1d1d1582dcc83092f7","observation_id":"97818603-d8b1-4009-b416-4ffbedb85cdf","resolution":{"observed_at":"2026-08-08T13:26:19.678910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.668029Z","title":"The singing voice conversion challenge 2023","venue":null,"work_id":"0180f4eb-5c7a-4903-9759-048c7ac8026b","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.301962Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:27af3b7a0fb1bf454f97cf6cb3cd979b1eb6c1ffdb965549062324e57486294f","observation_id":"7a190bd8-a972-40ec-b49f-710944c8370f","resolution":{"observed_at":"2026-08-08T13:26:19.671037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.659592Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"ed6e0039-5728-4b6c-a681-12b02e128b84","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.304779Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:a7c0c0a891a100571a7749c7e18719796103ef03905e7daa29a7420ed9f51543","observation_id":"41e9396b-97de-4d23-847c-cb904661bfc9","resolution":{"observed_at":"2026-08-08T13:26:19.662748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.651969Z","title":"Commonaccent: Exploring large acoustic pretrained models for accent classification based on common voice","venue":null,"work_id":"8d595fc1-3476-4c79-9b02-7f3da006623d","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.307589Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:f061a25e3e30a910fced29175819729d3d5eab972f2cba893e776b1dcb065e15","observation_id":"f129dbbf-ba2e-4d4d-b419-611e0c960a33","resolution":{"observed_at":"2026-08-08T13:26:19.654569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.644526Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":"3a2b424e-f65a-4f30-90c6-e8c7b3925afd","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.310413Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:c4b260f7ec99731db8d81a7c5058d891d8d3f09c65329e28d98ada2dd93210a3","observation_id":"d69f8ee8-2721-4124-a54a-686965e816ef","resolution":{"observed_at":"2026-08-08T13:26:19.647207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.637122Z","title":null,"venue":null,"work_id":"461b0086-e058-4aa0-b15a-91c47fe8cf3b","year":1982},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.313298Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:7246e7b50d51c281b80e7ca5c92649564298af80996ca074715f95a96da0b46a","observation_id":"08f94af4-4fca-4428-8029-ea535e194cae","resolution":{"observed_at":"2026-08-08T13:26:19.639684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.628630Z","title":"Libri-light: A benchmark for ASR with limited or no supervision","venue":null,"work_id":"3dd5a399-546f-41ff-a17d-8342ac77749f","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.316297Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:e3dbcf28696b90c09573cad393d2d82e7d64eaef176ae678681b74bd3a56b8d9","observation_id":"d2b6dc8d-aa5c-4335-a1a2-5d2e740ad999","resolution":{"observed_at":"2026-08-08T13:26:19.631954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.619570Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"febfb2ab-c136-4823-9809-2c32a2bd8ed9","year":2015},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.319210Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:791b92a4566ad6933863565cf2dfe60c819c141d00329fe91a3aaf8b733573ca","observation_id":"91b2c8cf-ee67-4ac5-a632-a16b75a59656","resolution":{"observed_at":"2026-08-08T13:26:19.622739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.610629Z","title":"Amphion: An open-source audio, music and speech generation toolkit","venue":null,"work_id":"41072723-0df2-476d-9e62-efc2025f6278","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.322124Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:c66f1c1df29d6d4cfe39ff52594018d9652030804000c490f6b42361bd440971","observation_id":"cc567952-405a-4834-803e-a1f8637b199a","resolution":{"observed_at":"2026-08-08T13:26:19.613920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.601680Z","title":"V oicecraft: Zero-shot speech editing and text-to-speech in the wild","venue":null,"work_id":"7d89e39c-1272-41bf-9bba-492b24c6b080","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.324971Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:101cbd74d2fbd0190d35563a1d2fd9aa8ce4f03d51863a0383394e192e6790b6","observation_id":"35599e59-9f1a-431a-b55f-394a892cbc4b","resolution":{"observed_at":"2026-08-08T13:26:19.605013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-07-06T20:26:17.112340Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15442","snapshot_observed_at":"2026-08-08T13:26:19.327889Z","title":"Overview of the amphion toolkit (v0.2)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.327889Z"},"links":{"cited_paper":"/paper/2501.15442","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:667312a639d47002b2e594a21e1f698a4da6ae6acd757e8e0650d09053a59183","observation_id":"d4d9660f-dee0-4fd3-836c-94376ab66820","resolution":{"observed_at":"2026-08-08T13:26:19.327889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.592735Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"8f89df06-b0f9-4e3c-ad08-f4e7ee3c6365","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.331052Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:f24d85fc0b18f5970d44c719bc64d0c978480822df9fb02d5ca7103e7b692932","observation_id":"f007b9ae-b6b3-4469-a20f-6ff698ee87a3","resolution":{"observed_at":"2026-08-08T13:26:19.596064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.583780Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"2880ebe6-ab58-48e4-8b2f-4d9252d2e637","year":2019},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.333766Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:9768952d3838dc819b38ea1549f3ae5aed18d93a2ee397ee3b1b22722417fdd0","observation_id":"8ea99c5d-0d73-46ab-a699-2c5b5fd2d259","resolution":{"observed_at":"2026-08-08T13:26:19.586922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.336676Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.336676Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:843ed96465a933140b0162b695cce105d1eca5ff00da0430548c20ac794ae094","observation_id":"f4437809-355c-4f4e-9839-d4877cffa94a","resolution":{"observed_at":"2026-08-08T13:26:19.336676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-08T13:26:19.339612Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.339612Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:03e627f982d6c1d2023b827d6db44812d7b36a6f51abdb5baeb79bee17cc1481","observation_id":"ef3c1bcf-7fce-40a9-a5af-1a4ec8b76b51","resolution":{"observed_at":"2026-08-08T13:26:19.339612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.570024Z","title":"Scaling speech technology to 1, 000+ languages","venue":null,"work_id":"cfa276e8-0423-425b-bf29-8653df8f5bbd","year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.342687Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:69c0796455897c15e162219d04414864d8ea31fdceef0c7808408fd85747caf1","observation_id":"71139633-d1f4-49e7-9afe-ed8423788c6e","resolution":{"observed_at":"2026-08-08T13:26:19.573407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.561387Z","title":"Conditional variational autoencoder with adver- sarial learning for end-to-end text-to-speech","venue":null,"work_id":"3ee79e3e-e9be-4e07-a1ad-53c0bd7d545c","year":2021},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.345544Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:db4707dbdf5d54e20d0eeae66cc9d57870830e7b3a656fd87018a71f448b8146","observation_id":"fab7ebe3-0ec2-4843-ae1e-2de7f9ddbfb5","resolution":{"observed_at":"2026-08-08T13:26:19.564600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.552590Z","title":"Weiss, Ye Jia, Zhifeng Chen, and Yonghui Wu","venue":null,"work_id":"bc3b92e3-28a5-4e39-8ec0-d159dcf736ac","year":2019},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.348402Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:c931cb9b35b4f4b38a099c586ab384c4a4a13d48abe1a3720360cb1a7fbf984b","observation_id":"f0be682c-099a-45b8-9852-3d4430a7214b","resolution":{"observed_at":"2026-08-08T13:26:19.555736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.351240Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.351240Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:64a633ced8a9e3aa1adc42c4261795c9776b49ed38dc70a18c5031491f4cd7f4","observation_id":"ed0f2eb6-4b91-4dec-9f18-5b4edbf627ae","resolution":{"observed_at":"2026-08-08T13:26:19.351240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.538240Z","title":"BART: denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension","venue":null,"work_id":"787b5d4f-1e43-4c55-9810-5d7ba7eb59d3","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.354382Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:d902bad88e384b082ee1c47d51fa0ac41a166926349487d82eb095711d8235b9","observation_id":"d2eb39b9-9991-480f-9f29-ec8fef4334f2","resolution":{"observed_at":"2026-08-08T13:26:19.541564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.529283Z","title":"CSTR VCTK Corpus: En- glish multi-speaker corpus for cstr voice cloning toolkit (version 0.92)","venue":null,"work_id":"8115157f-d62c-4713-87ee-52f657f9a8bd","year":2019},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.357239Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:d2f6285802dfba838fc830a18601b50e4f089d273c9c299ea3dc458149260ae0","observation_id":"c7454f28-2d70-4bc5-869a-936e0d8b3b9b","resolution":{"observed_at":"2026-08-08T13:26:19.532562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-08T13:26:19.360299Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.360299Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:e7d9c78fc07b53753cae773a7b594753f4ab9d9db0c3496a98309e54714a438b","observation_id":"0b0598f3-d986-426f-9a83-05f99e54586e","resolution":{"observed_at":"2026-08-08T13:26:19.360299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.520318Z","title":"MLS: A large-scale multilingual dataset for speech research","venue":null,"work_id":"7daa6faa-f3f3-4ad9-9ff6-be6211574513","year":2020},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.363655Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:d1486bcee30a96dbbbb1d250de7c1a19d4813a3bc73027bd9d26162528d2e4f4","observation_id":"050584c9-9979-4017-a8a1-00ce234971ad","resolution":{"observed_at":"2026-08-08T13:26:19.523449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.511474Z","title":"Gigaspeech: An evolving, multi-domain ASR corpus with 10, 000 hours of transcribed audio","venue":null,"work_id":"e78b9d72-4c7f-488e-961d-64d38ae43905","year":2021},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.366424Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:b32847230118b1f90dae0eb222d9010291c7b694a60c0d01a9394f7ee3e0c807","observation_id":"b8aac263-107c-4a80-9934-b90cdf3a6e72","resolution":{"observed_at":"2026-08-08T13:26:19.515151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.501640Z","title":"bit” vs. “bet","venue":null,"work_id":"6b343b9c-12a5-4fc9-a6fd-d613b6d3856e","year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.369265Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:cc1ea096380a1e3c1cd8d35569b75bf9a8550c8ad21e7ecf889b61496f60380c","observation_id":"06cef095-3980-4f5f-b5c1-4fef04f485f6","resolution":{"observed_at":"2026-08-08T13:26:19.505856Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:26:19.293571Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":4186,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.293571Z"},"links":{"citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:96849bef0ed69369c5d64591b97583e16dda39982f99980e948d513960c81dda","observation_id":"7687b7be-def6-4817-b4ce-463f6fe28086","resolution":{"observed_at":"2026-08-08T13:26:19.293571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 7 inbound Pith citation observations for arXiv:2502.07243."}