{"as_of":"2026-08-09T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb1ab85db5eb1f418a7a04ee63683ff54b4d75e234ef8ec88c0fc99da2fd92f0","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:41:51.092586Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T15:11:53.320505Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:37:35.394266Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2508.04996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04996","snapshot_observed_at":"2026-07-03T03:37:35.394266Z","title":"Ref-vc: Robust, expressive and fast zero-shot voice con- version with diffusion transformers,","venue":null,"work_id":"34ec4ef1-76ef-4d6c-ad3c-25ff11ff3c54","year":2025},"citing_paper":{"arxiv_id":"2606.09050","last_updated":"2026-06-08T05:39:23Z","snapshot_observed_at":"2026-08-01T21:36:59.520330Z","submitted_at":"2026-06-08T05:39:23Z","title":"MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T15:11:53.320505Z"},"links":{"cited_paper":"/paper/2508.04996","citing_paper":"/paper/2606.09050"},"observation_digest":"sha256:039c0734e864474b10ffd0111e45325ab84d27c4f001815f7bebd32851cde581","observation_id":"3a188814-2153-48c8-8567-0a8be66cdcae","resolution":{"observed_at":"2026-07-03T03:37:35.396279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.04996/citation-record","integrity":"/paper/2508.04996/integrity","json":"/paper/2508.04996/citation-record.json","paper":"/paper/2508.04996"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.351795Z","title":null,"venue":null,"work_id":"dfe702ba-4a8a-45e5-b097-1101ee967c17","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.018109Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:42b1779ba03caac93c5aad7dc3c313bfdc24a3647414a7fb9d7260c1a8105cc5","observation_id":"5f865cc5-d0ca-4be1-aa7d-4a14e91b1026","resolution":{"observed_at":"2026-08-05T23:41:51.354212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.344902Z","title":null,"venue":null,"work_id":"005ab6b0-a96c-42a0-86ce-564f485795ba","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.021002Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:f122c584b0c79c0023a4330d592c2a34c1e9bdb0a344a5e533a6a36ab7499b1b","observation_id":"b2f8d76c-6499-4369-8165-cccfce51b079","resolution":{"observed_at":"2026-08-05T23:41:51.347210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19770","last_updated":"2025-08-28T13:12:13Z","snapshot_observed_at":"2026-07-06T19:58:57.119904Z","submitted_at":"2024-11-29T15:18:01Z","title":"Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning","version":2},"cited_work":{"arxiv_id":"2411.19770","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19770","snapshot_observed_at":"2026-08-05T23:41:51.188070Z","title":"Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning","venue":"cs.SD","work_id":"cb937cc3-f957-416c-b507-d5cdfe756914","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.023535Z"},"links":{"cited_paper":"/paper/2411.19770","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:3b143e67e5dc16bccc4a25f6c67d5e80c06e264e69cdce6e17279e111bb37a93","observation_id":"8e24bd62-9aaa-4419-9f49-b82315374a49","resolution":{"observed_at":"2026-08-05T23:41:51.191181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.337885Z","title":"Huang, K","venue":null,"work_id":"b30d06a1-c3d5-4b06-9690-82684610ed05","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.026520Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:035249e07c127d03623c955f2b4345eda8eb4ea1c4fa6a4f634f36436fd9066b","observation_id":"54737e80-1c1c-42f1-9868-df0105f7c859","resolution":{"observed_at":"2026-08-05T23:41:51.340340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.330723Z","title":null,"venue":null,"work_id":"31cb83cf-4e9d-4ca6-acea-4c46b91792e5","year":2014},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.028995Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:71ab37f0614d116baa3d532550acc65938ebcdf30593226d9ecb5a118f50f335","observation_id":"c3274d14-aacf-4843-9a2f-d64c443a20fc","resolution":{"observed_at":"2026-08-05T23:41:51.332988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.323412Z","title":"Ahlawat, N","venue":null,"work_id":"93994fb9-eabb-4ae7-b915-085dc18662b9","year":2025},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.031508Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:01285c92e79e1d9235e686e04de1737bb991e9e64891a25081615ae9c883c5ad","observation_id":"189ec78c-3f1c-43f1-ba67-dff24b124a2c","resolution":{"observed_at":"2026-08-05T23:41:51.325995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.316365Z","title":null,"venue":null,"work_id":"7f40800c-5ad5-447b-9b09-c210271a284e","year":2016},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.034152Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:a5226f2ff03626e0dd3a88e26d6b2bdb0083d8a567b1d919865189c66987a4c2","observation_id":"5f56ffcf-8c8f-4c68-b586-1672afe97ab4","resolution":{"observed_at":"2026-08-05T23:41:51.318696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.308846Z","title":null,"venue":null,"work_id":"4702e060-eb0a-41fd-842b-11c599303de8","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.036561Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:c346c5321bf484bd879d517882bc92801aa902a106c65a4461f341f117c8a0fd","observation_id":"fe8b10cc-f3fb-43c8-b590-2f6fcd0bc41e","resolution":{"observed_at":"2026-08-05T23:41:51.311459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.301477Z","title":null,"venue":null,"work_id":"63439ce3-6c14-4b57-a1d3-144e6c3c749a","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.038848Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:bbbc91f48f659ec2ca342d240c08ab8eb22f23d0ee56a4b9d193fe266988b74e","observation_id":"c6dd4f9e-7302-4197-b081-1563cafa4b02","resolution":{"observed_at":"2026-08-05T23:41:51.303924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.293798Z","title":null,"venue":null,"work_id":"032d70ab-4764-40c2-a4b3-4a3b66e80888","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.041073Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:1dd5b2d84c0276b29f8912047da7686d0de247539961ae8c5f27a318cac44d66","observation_id":"2ede95de-7c3c-404b-b1d3-34966b782cf1","resolution":{"observed_at":"2026-08-05T23:41:51.296529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.286830Z","title":"Baevski, Y","venue":null,"work_id":"d4bdd23b-622e-4e9f-a426-7c6b9c85b512","year":2020},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.043439Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:1b7522361475784124ba1cca9114579dfe0dda05cc202ea9749bbb07bccf1434","observation_id":"6fe42ee7-42ed-44f5-a4fb-2abeca115d87","resolution":{"observed_at":"2026-08-05T23:41:51.289123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.279818Z","title":null,"venue":null,"work_id":"3b9363ae-d482-416c-b810-45fc386b342f","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.045760Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:e543dc1c6135ba927395b878c015655d7982d3ecb69fb6da54262000ccf96860","observation_id":"58b1b59f-a6e3-4bd0-8175-590efc7552a3","resolution":{"observed_at":"2026-08-05T23:41:51.282305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.272576Z","title":null,"venue":null,"work_id":"424b8576-5308-4318-9cd3-6d5eb3a31166","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.048117Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:723a92cb624fe05c96f76829cde6e1bd3e14b3d364d17aa113fc2355c3d30ee9","observation_id":"cfa380e1-aa18-4156-9bc1-ff3102f9232b","resolution":{"observed_at":"2026-08-05T23:41:51.274992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.265276Z","title":"Neekhara, S","venue":null,"work_id":"24120344-f09c-495f-bb45-5942deaf2fb4","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.050305Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:f6ca49561ecfb8cf60cf6ec24470e80135a4119906f4d07a2c1c89a84dab573a","observation_id":"57a14e60-4fbe-49f9-b3d9-4134317b4e06","resolution":{"observed_at":"2026-08-05T23:41:51.267767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.258073Z","title":null,"venue":null,"work_id":"3f46de84-aefb-49a4-8681-307dcbc2848f","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.052572Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:dd890a32eb860bbbced3f90e707f100801bc5816786f67dd365042f854cfc2b3","observation_id":"ba2686fd-7807-4d61-b3fa-af9762bd8b16","resolution":{"observed_at":"2026-08-05T23:41:51.260291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09844","last_updated":"2024-06-14T08:51:31Z","snapshot_observed_at":"2026-07-06T18:30:50.693663Z","submitted_at":"2024-06-14T08:51:31Z","title":"Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy","version":1},"cited_work":{"arxiv_id":"2406.09844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09844","snapshot_observed_at":"2026-08-05T23:41:51.177054Z","title":"Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy","venue":"cs.SD","work_id":"f105d276-b374-4362-a670-864a4254557f","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.054837Z"},"links":{"cited_paper":"/paper/2406.09844","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:3ee8eac9e59fe1d3f46ae65d67dbc8ae0cf288532dc1347b0b8e59131c166d31","observation_id":"f8592b0d-751d-401a-9be7-643a10ec333c","resolution":{"observed_at":"2026-08-05T23:41:51.180342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16147","last_updated":"2025-09-10T13:42:20Z","snapshot_observed_at":"2026-07-06T19:56:21.333277Z","submitted_at":"2024-11-25T07:14:26Z","title":"QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion","version":2},"cited_work":{"arxiv_id":"2411.16147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16147","snapshot_observed_at":"2026-08-05T23:41:51.165667Z","title":"QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion","venue":"cs.SD","work_id":"f671f763-fb5b-452b-8468-4c5715f02aeb","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.057371Z"},"links":{"cited_paper":"/paper/2411.16147","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:acdffedd5d2b7cf259ae73e2d649efef51cdae6410fc18c74dc8b1605024a317","observation_id":"66587279-1146-452e-8ebd-f987afef12f7","resolution":{"observed_at":"2026-08-05T23:41:51.168878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01350","last_updated":"2025-01-10T05:35:32Z","snapshot_observed_at":"2026-07-06T19:25:48.444990Z","submitted_at":"2024-10-02T09:07:33Z","title":"Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling","version":2},"cited_work":{"arxiv_id":"2410.01350","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01350","snapshot_observed_at":"2026-08-05T23:41:51.151962Z","title":"Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling","venue":"cs.SD","work_id":"6d754432-7820-42a5-882f-17e69699940a","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.059823Z"},"links":{"cited_paper":"/paper/2410.01350","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:1dcf74cc26db37826cfa0a0582449a4c2fe090738a06cba43cfcc48f32ce70eb","observation_id":"c2fda04f-302d-4776-940c-016614f39ffd","resolution":{"observed_at":"2026-08-05T23:41:51.156909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.250441Z","title":"Peebles and S","venue":null,"work_id":"f6d9e4f5-d6a8-41b1-a96d-dbc96941adf9","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.062258Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:218b165f3010e976e19cd1e6a64f6a7d9ae1b827a5c30bf4915acafc58accac7","observation_id":"74304bea-a1a5-48d6-9a33-ce73d973b29f","resolution":{"observed_at":"2026-08-05T23:41:51.252761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.242735Z","title":null,"venue":null,"work_id":"5f64f160-4107-4c60-b145-ac8d8b0c3bc8","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.065138Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:dd54877d8d8ceed041ffc6f20b81a52d87269f29bcb49568e5a4bb73fbe00186","observation_id":"52833e86-8688-4ccc-99db-7caf7db748aa","resolution":{"observed_at":"2026-08-05T23:41:51.245248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.235298Z","title":"Lipman, R","venue":null,"work_id":"79652eef-f22c-4927-ae0c-52046522a71b","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.067347Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:35f9be1fc1cd19881c66f014a05a1e66e48e0fac8ee9628415edc6f1b6d193b5","observation_id":"42505878-1417-4968-95b5-912fe957e151","resolution":{"observed_at":"2026-08-05T23:41:51.237959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-08-05T23:41:51.069496Z","title":"Frans, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.069496Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:aae3d0a308e0d3a20a7fa2a60a65a4e05144bbc32bda57f12eae2e5b5b183d07","observation_id":"c70d84c3-9f5a-4025-b514-2decc5cc80b4","resolution":{"observed_at":"2026-08-05T23:41:51.069496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-06T16:37:49.547342Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-05T23:41:51.071923Z","title":"Liu, ``Zero-shot voice conversion with diffusion transformers,'' CoRR, vol","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.071923Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:350143bbbcfe38484778c759b6f6d042e3be0b4e9dfc4d56b3de7087b966fa57","observation_id":"b728c6e2-5022-4993-a1fa-bde3f00b2e67","resolution":{"observed_at":"2026-08-05T23:41:51.071923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.227679Z","title":"Zhang, D","venue":null,"work_id":"53d3d03d-623c-42f3-b846-3148148a7ef6","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.074375Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:35705163dd0ebdc88c353b7da872f07414291d4e5cc60820d1d00e0f2da80518","observation_id":"8cbf8caf-4132-4b36-9c3a-842a81a0f745","resolution":{"observed_at":"2026-08-05T23:41:51.230247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.220302Z","title":"Jayashankar, J","venue":null,"work_id":"a8e06508-b77c-48d2-b190-054623f568e0","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.076682Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:a5bbae5b359ca08ebd7bca42794fa611687221c48653e8fdaa7bf9900ce4dc20","observation_id":"ed4054a2-1290-4704-b946-0b37a39af6ca","resolution":{"observed_at":"2026-08-05T23:41:51.222839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.212905Z","title":null,"venue":null,"work_id":"7229dd70-7957-4b63-a8fa-8540c3ade71d","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.078846Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:c3ff9a7054b9cf540b4cf7b4b482f250db082fa2d2bb2df6415dae54f81ae0c3","observation_id":"4f11c4cf-f5d9-4d90-aaac-f710c39d1507","resolution":{"observed_at":"2026-08-05T23:41:51.215301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-05T23:41:51.083471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.083471Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:4b165ee097deb64e9eb4bebe2c836bf246b91078edd7b2490cf4b037732e2fb9","observation_id":"2dd37568-2bd1-4ee7-bb30-6599b6d618ad","resolution":{"observed_at":"2026-08-05T23:41:51.083471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.204557Z","title":"Zhang, H","venue":null,"work_id":"8d5e4a8e-32d7-4271-8ea3-2de346969b47","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.085845Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:11265b92ae70c0e0f59cd48fb0ade8beb84368e0950a06a51036edcffbe3b532","observation_id":"9d386117-4436-49f6-9458-055c5007e1e9","resolution":{"observed_at":"2026-08-05T23:41:51.207456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.196590Z","title":null,"venue":null,"work_id":"65d64575-b89c-4eeb-b71c-b5dd080a08ae","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.088055Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:0aca45f055c1b1545bde1a78e714ba3fb8e2fbb04ee17c6b329a4daadc136654","observation_id":"af3198a7-5581-4950-8216-5caadd1fe53a","resolution":{"observed_at":"2026-08-05T23:41:51.199452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-05T23:41:51.090161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.090161Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:402f2fc3c4f3497648a8ce08ddb707937d931e35e05b68aef3e57801e4b91504","observation_id":"68fb7631-fa48-4740-92ed-bf2752351d82","resolution":{"observed_at":"2026-08-05T23:41:51.090161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-07T11:14:08.982821Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-05T23:41:51.092586Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.092586Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:69345348185c3b30f8c29d67d6094a6b38544f67ba88dc9cb81dc38cbb7ecfc7","observation_id":"c2682900-ab98-4dc0-b954-d0f4287430d1","resolution":{"observed_at":"2026-08-05T23:41:51.092586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":4,"verified_fuzzy":9},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2508.04996."}