{"as_of":"2026-08-07T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5e1c2324004eec0487d338599d3d994eccdae7549168425c2ee0b0ed43e054a","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:43:55.149647Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:43:48.766757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:43:55.756459Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"cited_work":{"arxiv_id":"2507.04817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04817","snapshot_observed_at":"2026-08-06T19:43:55.756459Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","venue":"cs.SD","work_id":"56c170b2-309d-4bc5-881f-3105326bcfc7","year":2025},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.766757Z"},"links":{"cited_paper":"/paper/2507.04817","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:1e8f545f15774371543c61c8de919f51173417e148db7cd6f024f51f2912ac52","observation_id":"af0842b0-1efd-4025-a815-8962edf87243","resolution":{"observed_at":"2026-08-06T19:43:55.831971Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04817/citation-record","integrity":"/paper/2507.04817/integrity","json":"/paper/2507.04817/citation-record.json","paper":"/paper/2507.04817"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.781691Z","title":"By definition, this task requires altering vocal identity, which raises fundamental questions about what features define a speaker’s voice and how they should be manipulated","venue":null,"work_id":"b1b139f3-4774-49fb-b44d-f452d1ceb5ea","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.665446Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:9d4500643a73b05b3457437e1b876f3ea09dca4ded1e2ede7294281e03dc4b7e","observation_id":"e6271d0e-93ee-4447-8e9c-8c940bdfcb62","resolution":{"observed_at":"2026-08-06T19:44:06.837152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"cited_work":{"arxiv_id":"2507.04817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04817","snapshot_observed_at":"2026-08-06T19:43:55.756459Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","venue":"cs.SD","work_id":"56c170b2-309d-4bc5-881f-3105326bcfc7","year":2025},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.766757Z"},"links":{"cited_paper":"/paper/2507.04817","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:1e8f545f15774371543c61c8de919f51173417e148db7cd6f024f51f2912ac52","observation_id":"af0842b0-1efd-4025-a815-8962edf87243","resolution":{"observed_at":"2026-08-06T19:43:55.831971Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.646662Z","title":"Our goal is to design a model capable of transferring a specific utterance from one speaker to another speaker’s timbre, while relying on high-level control features","venue":null,"work_id":"874274ee-cc98-4f0f-8faf-3d3b47894195","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.860480Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:de679e8a7742861a3ccd8985e6ed9b46065133b3263991de2e0197f0d6c2b62f","observation_id":"3d809919-9110-41b1-8965-7d414d95e58d","resolution":{"observed_at":"2026-08-06T19:44:06.710310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.468504Z","title":null,"venue":null,"work_id":"4da30c09-84af-47f8-a7b9-0afe6716b4bd","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.923877Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:69c4ade7823080529da91968bac4bda55fd2102ab8d4a2b916b6aef16ddeeac3","observation_id":"5bac2929-86b9-45a4-8c98-876e6f352e73","resolution":{"observed_at":"2026-08-06T19:44:06.565441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.314586Z","title":null,"venue":null,"work_id":"31f138f4-913d-4fdc-ae99-62504da50032","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.013694Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:ed43d59b436704ad0167980fefa7f1f1300663c1fb345a656526a226e78b8127","observation_id":"cbab6189-76ce-48c5-9706-8e8947ce2591","resolution":{"observed_at":"2026-08-06T19:44:06.399057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.174334Z","title":null,"venue":null,"work_id":"4b11d1b5-8fd7-4976-b4cd-7de50976143e","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.150687Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:f21ffc6caf4a22f7a1911cbb436e9a61503e7d9e7578dabd64738ea120ac8664","observation_id":"0b3ff3e5-3473-4fef-b0c0-fcdacb0eda78","resolution":{"observed_at":"2026-08-06T19:44:06.240199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.025131Z","title":null,"venue":null,"work_id":"f14556b2-19b1-45fb-9b49-152f8e9518c8","year":2025},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.284738Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:b4b84aeca4abb08ad623baab9f4a760622972055a61b540e98e84d1ca52ce70f","observation_id":"437f8c07-19d0-4473-bfe4-3d61edf5dffb","resolution":{"observed_at":"2026-08-06T19:44:06.102820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:05.715418Z","title":"Reimagining speech: a scoping review of deep learning-based methods for non-parallel voice conversion,","venue":null,"work_id":"d6a52b1a-fe2f-4422-9c27-4dce7357e7ec","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.410056Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:16c3ef013fd59fe8eae3ca5239cc1bfaff930b47a90f7bb757f2ada3710648d9","observation_id":"95a59a38-4f86-4122-a4c7-4d10a4ae5ab3","resolution":{"observed_at":"2026-08-06T19:44:05.908966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:05.342858Z","title":"An Overview of V oice Conversion and Its Challenges: From Statistical Modeling to Deep Learning,","venue":null,"work_id":"aa9372bc-826d-4fe0-91ff-5e892138340f","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.518760Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:7039e09cdb36862dc4f58277292dc4882bf51660c939bf608369bb906c7b4219","observation_id":"d7d73e5b-8e83-44d4-8210-022251f1fe94","resolution":{"observed_at":"2026-08-06T19:44:05.580677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:05.107458Z","title":"AutoVC: Zero-Shot V oice Style Transfer with Only Autoencoder Loss,","venue":null,"work_id":"36b1dfb8-5f03-4781-af61-eeff06bf70a9","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.670563Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:033007b4311d4329c690daa5783f69e5492b4ec79d7a522415ed9d9ac5f19531","observation_id":"560a9be0-a592-4f2d-b285-b52b400aab9c","resolution":{"observed_at":"2026-08-06T19:44:05.225196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.840369Z","title":"Diffusion-Based V oice Conversion with Fast Maximum Likelihood Sampling Scheme,","venue":null,"work_id":"b2f14daf-76eb-45cf-b356-af9970c47476","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.755966Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:c8353decc0ece4e607044153ba1046c1d8805cb03675ee2208d57b05a7e4f520","observation_id":"89d3a7b5-142d-435a-abdc-0d35f6409880","resolution":{"observed_at":"2026-08-06T19:44:04.979665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.592793Z","title":"QUICKVC: A Lightweight VITS- Based Any-to-Many V oice Conversion Model using ISTFT for Faster Conversion,","venue":null,"work_id":"7751d449-845e-4b25-99ae-c61c77493add","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.868443Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:a16afff9ba261a560605013dabd222125397b68fb17f652bd8cc808dcca2191b","observation_id":"e86c7ebd-20a4-4642-b691-73c56d2b0396","resolution":{"observed_at":"2026-08-06T19:44:04.719525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.383933Z","title":"V oice Reenactment with F0 and timing constraints and adversarial learning of conversions,","venue":null,"work_id":"13b831a5-6bc1-4b39-b424-7c9eddbebfab","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.027088Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:70e16490e2ecdd0b4dd76e4d1a7b69701b298352f806d7abdb5572f376e59a9c","observation_id":"690b77c8-df77-41cf-9365-382baaf5fd1c","resolution":{"observed_at":"2026-08-06T19:44:04.494351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03364","last_updated":"2023-09-06T21:16:58Z","snapshot_observed_at":"2026-07-06T16:15:27.717075Z","submitted_at":"2023-09-06T21:16:58Z","title":"Highly Controllable Diffusion-based Any-to-Any Voice Conversion Model with Frame-level Prosody Feature","version":1},"cited_work":{"arxiv_id":"2309.03364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03364","snapshot_observed_at":"2026-08-06T19:43:55.583534Z","title":"Highly Controllable Diffusion-based Any-to-Any Voice Conversion Model with Frame-level Prosody Feature","venue":"cs.SD","work_id":"9744f03a-31ff-44f4-8cef-a1f0b5094824","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.141700Z"},"links":{"cited_paper":"/paper/2309.03364","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:df847eecc080ce93fd2622a6f60fe8bf4728b6f1b6aef5d51e502ddbb56a873d","observation_id":"4a413726-2ec9-4443-b062-9c9673b49b8e","resolution":{"observed_at":"2026-08-06T19:43:55.676440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.156280Z","title":"HiFi-VC: High Quality ASR-based V oice Conversion,","venue":null,"work_id":"345904dd-a90b-4ad5-895f-31c251adb99a","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.212871Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:9e799d5f1408203968cf1474f1bab0a1319e1af26d7a8b8c4919473862adce7d","observation_id":"2ca0df46-f346-4ee6-934f-f85cc1210acc","resolution":{"observed_at":"2026-08-06T19:44:04.262943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.880488Z","title":"ControlVC: Zero-Shot V oice Conversion with Time-Varying Controls on Pitch and Speed,","venue":null,"work_id":"3cefcb37-8f5c-4294-a382-334b2ba6d16a","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.286968Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:bba59e3edf047a1573616a34c979e6b86e057c3d96c72970dd7c0b587264f691","observation_id":"d64400bf-cf12-4034-9d6e-a852eb9626a6","resolution":{"observed_at":"2026-08-06T19:44:04.043763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.817745Z","title":"V oice quality: the 4th prosodic dimension,","venue":null,"work_id":"a1b2bb50-5a71-4173-b1d0-e5899722a21a","year":2003},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.373858Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:86a5b6285568a6fb997b7871fd13f80609845f6c1cb4fb268ee2a82258280624","observation_id":"34c55e29-a92e-441e-8630-627cadf2147f","resolution":{"observed_at":"2026-08-06T19:44:03.843020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.523267Z","title":"Manipulating V oice Attributes by Adversarial Learning of Structured Disentangled Representations,","venue":null,"work_id":"d6e4cd38-8074-480f-bec9-0f3ff9d4a7b0","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.452282Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:28c26366bdd0659003378a84b14d3efcc1f4a70d626872efbf3cee97ac372248","observation_id":"e42942e3-7a45-4dc4-8cc6-7d8c88527247","resolution":{"observed_at":"2026-08-06T19:44:03.683411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.259055Z","title":"End-to-End Adversarial Text-to-Speech,","venue":null,"work_id":"d55ce72d-c167-418e-b891-307f8a63d5ba","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.544792Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:e61f7125e693915500118b513391d9c6ad4fb41350fcccb6cc739f0c455524eb","observation_id":"ca9d93d8-185c-46a6-8b20-e3225999ea28","resolution":{"observed_at":"2026-08-06T19:44:03.391963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.993437Z","title":"Disentangling prosody and timbre embeddings via voice conversion,","venue":null,"work_id":"739b9eab-8ee4-4524-87c8-ac4eb7259057","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.704602Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:2fd766b1716137c204fd11baaa2b40580e29a922dec42908fdf12ddaf9c9d4f6","observation_id":"65a90cea-3f05-4e5a-bf15-1b3c9eb80515","resolution":{"observed_at":"2026-08-06T19:44:03.134353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.679795Z","title":"Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation,","venue":null,"work_id":"0ee45b12-9140-4d8f-a748-1aae02e31847","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.827672Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:32b6284453cef1e4455ca7f16af981db96f2dfc6a347c20214fa34389fd8da6f","observation_id":"67ac75a4-6da6-4e52-a106-d14451ebe706","resolution":{"observed_at":"2026-08-06T19:44:02.856291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.344926Z","title":"Disentangling prosody representations with unsupervised speech reconstruction,","venue":null,"work_id":"0c9ac9a0-b98c-487d-8cde-dbd0b6468efd","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.976593Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:09b025b4528c23d5a2cfbf767ff8016389c3d7f7ac311a9726607de34689c8b0","observation_id":"a859b182-4552-4fbc-8f88-89c84b9a373c","resolution":{"observed_at":"2026-08-06T19:44:02.496682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.04730","last_updated":"2021-11-07T08:52:04Z","snapshot_observed_at":"2026-07-06T12:06:38.623845Z","submitted_at":"2021-11-07T08:52:04Z","title":"Emotional Prosody Control for Speech Generation","version":1},"cited_work":{"arxiv_id":"2111.04730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.04730","snapshot_observed_at":"2026-08-06T19:43:55.459660Z","title":"Emotional Prosody Control for Speech Generation","venue":"eess.AS","work_id":"a818d9f2-725c-418d-a2ba-8059928a2945","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.104126Z"},"links":{"cited_paper":"/paper/2111.04730","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:09fe03eeb9faa59cb2124278b4c9a0cb3b3a4c5327e70c9ae2499aaaaace6f03","observation_id":"e237feee-9d18-4493-900b-38c5941f2db3","resolution":{"observed_at":"2026-08-06T19:43:55.504763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.082302Z","title":"Advancements in real- time voice conversion technologies: A comprehensive analysis of techniques,","venue":null,"work_id":"58d19fd1-d8fc-4b06-8827-75ce7aa8149c","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.195942Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5dcce77a06400038dda9d002cd413d3a1049722d8729fc49a77113648360573f","observation_id":"c4d2fdc4-709c-4532-8fe7-c1b85a7fa4c7","resolution":{"observed_at":"2026-08-06T19:44:02.210081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.831005Z","title":"Robust and fine-grained prosody control of end-to-end speech synthesis,","venue":null,"work_id":"8e9e926e-2890-4f94-a635-fd71cacc8ce2","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.307336Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:d6b2ddadeb5d24eae744368c6985879f26175c2efa53b89b4d35befbc6ac30f7","observation_id":"a9ad8fee-aa76-441d-b646-2580fbc5cfc4","resolution":{"observed_at":"2026-08-06T19:44:01.980137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12973","last_updated":"2021-06-20T04:01:15Z","snapshot_observed_at":"2026-08-02T08:54:24.831703Z","submitted_at":"2020-10-24T20:16:03Z","title":"Unsupervised Learning of Disentangled Speech Content and Style Representation","version":2},"cited_work":{"arxiv_id":"2010.12973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.12973","snapshot_observed_at":"2026-08-06T19:43:55.324808Z","title":"Unsupervised Learning of Disentangled Speech Content and Style Representation","venue":"cs.CL","work_id":"08b6c7b9-5826-4b6b-a606-33331c908aaf","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.424641Z"},"links":{"cited_paper":"/paper/2010.12973","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:08923f21bbfad8e191e0e029ace8ad208b269c8d30f11a8484bc58abe80328d9","observation_id":"3738cc29-7e58-4f12-a887-f8ec3f871cf5","resolution":{"observed_at":"2026-08-06T19:43:55.384498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01678","last_updated":"2021-06-17T12:50:49Z","snapshot_observed_at":"2026-08-03T12:31:04.097299Z","submitted_at":"2020-11-03T13:08:53Z","title":"Learning Explicit Prosody Models and Deep Speaker Embeddings for Atypical Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01678","snapshot_observed_at":"2026-08-06T19:43:51.566419Z","title":"Learning explicit prosody models and deep speaker embeddings for atypical voice conversion,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.566419Z"},"links":{"cited_paper":"/paper/2011.01678","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:e1554ce8965974381a8c63132c79df17b03bdfd20ac1dbe9be3b97820bf8cc1f","observation_id":"256ae7b8-ff57-43fc-97e6-081df197c138","resolution":{"observed_at":"2026-08-06T19:43:51.566419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.633382Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":"9719e2c8-a1e7-4ec0-b289-b49cdcfc2a63","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.704968Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:218cb44cd2040a589881b8c5c59a7bd5a988b9658bf2037adabc7899f5169e65","observation_id":"584013d7-8e97-4a90-a1ee-c099686efcf3","resolution":{"observed_at":"2026-08-06T19:44:01.710075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.294193Z","title":"WORLD: A V ocoder-Based High-Quality Speech Synthesis System for Real- Time Applications,","venue":null,"work_id":"d679738c-19da-40ff-b6b6-10fd9c69818c","year":2016},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.825059Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:095b7903dde4b496fc561273adf655c81f7e460ba1143e909760ed3e87f0530a","observation_id":"f348eb57-9108-4ad0-b18b-269a84f920fd","resolution":{"observed_at":"2026-08-06T19:44:01.468987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.965727Z","title":"How far are we from robust voice conversion: A survey,","venue":null,"work_id":"bb8826a0-202e-48e5-b635-8a6a4d81adbf","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.942770Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:d5b2541b85c05beb758b3ec6ff4122726323ab796ce457300a5d34da1179637b","observation_id":"ed1deacd-7751-4fee-8a9a-98ea0b036e5d","resolution":{"observed_at":"2026-08-06T19:44:01.128481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.656611Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"9e8ae91d-ae5a-402d-a1a5-08a137786810","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.101576Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5950f43e7c7fef5314e0d1afb9f5a974fc135b0ce4b24697399675bca0ff19f5","observation_id":"a11979b3-da0b-4465-9b24-b7f1b589dec4","resolution":{"observed_at":"2026-08-06T19:44:00.785700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.10326","last_updated":"2022-07-21T05:10:48Z","snapshot_observed_at":"2026-08-05T01:15:39.596807Z","submitted_at":"2021-10-20T00:49:02Z","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.10326","snapshot_observed_at":"2026-08-06T19:43:52.224133Z","title":"Disentanglement of emotional style and speaker identity for expressive voice conversion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.224133Z"},"links":{"cited_paper":"/paper/2110.10326","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:ef877441595b14b05d6bc96cf117e4b16c7c6909eaca927fff0a6a7533a372eb","observation_id":"37ae0da2-80fa-4e81-8382-fab7ed6cb300","resolution":{"observed_at":"2026-08-06T19:43:52.224133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.353174Z","title":"Diphone synthesis using an overlap-add technique for speech waveforms concatenation,","venue":null,"work_id":"8e1c10cc-19b9-4654-8a0e-6c5577051609","year":1986},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.359505Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:116d5387a1f753b787f9dbfe3eb9017812771e1801b959b517b32fde13726516","observation_id":"b3c78abe-0557-433d-9f8d-ab6101cb3bc8","resolution":{"observed_at":"2026-08-06T19:44:00.477323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.074377Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"0ad549b3-599b-4266-a5a4-ebb27718dc3b","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.455359Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:c04214b809c243b2304d0cb35c16845c8ebc7271bd7045ca95e4f8cdf3778020","observation_id":"adae3760-e952-47c1-a19d-904b61801227","resolution":{"observed_at":"2026-08-06T19:44:00.206739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.553201Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.553201Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:9033c7de2e62ed19d6c1b902f62a6e92aa322c9a95ed43b3aa81f5e323b2180d","observation_id":"b79f8883-801b-4f8b-8ca0-63b19592220a","resolution":{"observed_at":"2026-08-06T19:43:52.553201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.865850Z","title":"Fast and reliable f0 estimation method based on the period extraction of vocal fold vibration of singing voice and speech,","venue":null,"work_id":"eeffbf24-a05c-4daf-ba98-2d69d3cc74fd","year":2009},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.678658Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:40139c474e2ebfcf37236e22a568397c0f688f2e4a62b166be2ea323b463895e","observation_id":"6cca6754-7fab-41b3-ad2c-51e73feb035e","resolution":{"observed_at":"2026-08-06T19:43:59.968267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.630288Z","title":"Crepe: A Convolutional Representation for Pitch Estimation,","venue":null,"work_id":"46aa5c24-5007-46ec-b681-916cff8023c3","year":2018},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.822915Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5ec732ae19deaf3841757432f20f21ab07435a8677128bdb7ac1fe35e9a6cf21","observation_id":"58df1813-5279-4d0c-a85a-b523ae72d9d7","resolution":{"observed_at":"2026-08-06T19:43:59.739962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.399039Z","title":"Fully-Convolutional Network for Pitch Estimation of Speech Signals,","venue":null,"work_id":"c8c9b05e-85ad-45c7-9d1e-3b6a02ef1301","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.944813Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:b58950ab90c4a18bdec404bb1997e10db94951e3bee6fd12b5f2e908f9be64ac","observation_id":"e07c0bb8-b61a-4ee7-ae28-7ab7f58b05a9","resolution":{"observed_at":"2026-08-06T19:43:59.551423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.107685Z","title":"Parallel-Data-Free V oice Conversion Using Cycle-Consistent Adversarial Networks,","venue":null,"work_id":"24c65729-e4b7-48f8-87d9-738c5269da2d","year":2017},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.057287Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:763d42f20eaac7f383ed68155e46faa0e48409ef33d3d1af53a2ae2ec55bb6d6","observation_id":"a1ce2f2b-048c-46d7-b26a-a87c1df6d51c","resolution":{"observed_at":"2026-08-06T19:43:59.215285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.888168Z","title":"CycleGAN V oice Conversion of Spectral Envelopes using Adversarial Weights,","venue":null,"work_id":"f2a3e718-c320-4691-a273-1215bbf083b5","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.165721Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:22d744f91849100e95477dba16707f6a2da0cb0da2da71c32c6641c32c090deb","observation_id":"c33e7b2e-e94d-4817-8fbf-a2a7d87de339","resolution":{"observed_at":"2026-08-06T19:43:59.021455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.667781Z","title":"StarGAN-VC: Non-parallel many- to-many voice conversion using star generative adversarial networks,","venue":null,"work_id":"cb37f282-59ac-49f9-98d1-3417fe0829be","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.291405Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:2ecddf6cc13a6fb6291ccf33f52969e008e862fefec64a4eb8e66622d4910406","observation_id":"afa3d4e4-ed9d-453d-bca3-09dd40fd29fd","resolution":{"observed_at":"2026-08-06T19:43:58.780887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.473192Z","title":"StarGAN-VC2: Rethinking conditional methods for stargan-based voice conversion,","venue":null,"work_id":"fde2d5e3-47ed-4e46-bacb-2451fca25f1b","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.434800Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:ceecaec3c360a0a24731ec86553f59f612f09f7717188bdbcb92c3116a9d0af9","observation_id":"74b8b7af-12e2-4549-bbfe-d8fa8cd42606","resolution":{"observed_at":"2026-08-06T19:43:58.567884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.253570Z","title":"Nvc-net: End-to-end adversarial voice conversion,","venue":null,"work_id":"946a483d-bbe0-449e-b54e-4d12939633ff","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.576804Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:fcb0d26c26ad23958c8f8a357cd5d577ab1b20d4c6844bf287c87432c5fb3d08","observation_id":"a96cc1b0-cf41-42f6-88fa-9955e9982843","resolution":{"observed_at":"2026-08-06T19:43:58.362880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.951273Z","title":"Avqvc: One-shot voice conversion by vector quantization with applying contrastive learning,","venue":null,"work_id":"96ce1adf-24f1-42e0-be4b-5ad19c4e325f","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.692366Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:739ea760ac00532673ba96fa42049bd150126494b789f7160b0d2fa7c0fb88c8","observation_id":"da8c866d-87e4-475e-b11b-fd9d3b7c4535","resolution":{"observed_at":"2026-08-06T19:43:58.120965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.713765Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech,","venue":null,"work_id":"18c9d40d-bbb7-4741-ba41-39b529c1c0d4","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.855605Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:cc794ca0ce889017503ffc7498db0a50dbc8dfd4fee14da94cf4d043a0e879a5","observation_id":"c857043d-300d-4972-b513-066c7130b297","resolution":{"observed_at":"2026-08-06T19:43:57.825406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.387149Z","title":"DDDM-VC: Decoupled Denoising Diffusion Models with Disentangled Representation and Prior Mixup for Verified Robust V oice Conversion,","venue":null,"work_id":"b14dfe43-1183-4e28-b611-e3a668258c55","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.979278Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:a9e6ecd35f4ba4e39a8787627ab3c26e71e8c9bf4fc76de076b7860515414685","observation_id":"364c84bd-56c3-4de2-b9ef-0051c4559976","resolution":{"observed_at":"2026-08-06T19:43:57.533601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.151503Z","title":"Neural V ocoding for Singing and Speaking V oices with the Multi-Band Excited WaveNet,","venue":null,"work_id":"23f271ca-b5d2-4e4d-a256-6514b48c0cf3","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.094452Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:8982e5da9db2b3da108e944fff86359a616ca67b7e30b3ca90bb470c29ba2319","observation_id":"67904853-c112-45f9-bf9d-2afbc5cd2bb2","resolution":{"observed_at":"2026-08-06T19:43:57.217083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.039641Z","title":"Revisiting Over- Smoothness in Text to Speech,","venue":null,"work_id":"3f34f0b8-f472-44a6-abe9-c408249f7b66","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.196067Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:af5a753f4b0e801088cc121a9add5ee0561021c0b7d5f54ab0c08427e28062f3","observation_id":"b3746af1-f5fc-446f-8e52-ae36e5fdb0c5","resolution":{"observed_at":"2026-08-06T19:43:57.091318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.894272Z","title":"On temporal constraints for deep neural voice alignment,","venue":null,"work_id":"66c0a894-0e8b-429f-bc51-a4562ef230c3","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.308464Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:2c744ec3737dc437563d80c5b8371dc59ee2f3185b2a7a2577b5520f8b1e4063","observation_id":"e28989d2-8a53-47af-9f1b-184d800c612a","resolution":{"observed_at":"2026-08-06T19:43:56.953867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.751320Z","title":"Festival speech synthesis system: system documentation (1.1. 1),","venue":null,"work_id":"13818a2d-6379-4103-8a92-75f64c1b13a4","year":1997},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.430243Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:d2856df013e7cab49895e91a848272c230afd1e4706652ab833d47e96020a9f4","observation_id":"e9140faf-69ab-42d4-baa8-2b65c86dcafa","resolution":{"observed_at":"2026-08-06T19:43:56.821804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.623524Z","title":"LIA—PHON: Un syst `eme complet de phon ´etisation de textes,","venue":null,"work_id":"7b2b938a-d1d0-461a-83c0-72d9aa2a6832","year":2001},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.528990Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:6b4a409d1f5365e3d201919037ff1b7ce0182d631df72f5e40b527332509b03e","observation_id":"cc897052-b2c6-4b4b-a68c-2c4d2b2cffd3","resolution":{"observed_at":"2026-08-06T19:43:56.680698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.492650Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92),","venue":null,"work_id":"c0185eee-7c98-4e42-b873-76fa69673108","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.621506Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5bb6a51113bd041f3157854ca55e85c681e595bc43c12c913ef42089f2bed759","observation_id":"fc158ba4-00be-4bec-b29a-1f02963eae5e","resolution":{"observed_at":"2026-08-06T19:43:56.567096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.367163Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis,","venue":null,"work_id":"0fa0ea02-17b0-429e-96fc-381d962bb010","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.746080Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:4f9f93d538cc161618226b0927d90e1fa21fc95ec943a5c32f45c0008b20b9dd","observation_id":"adfd286b-ff4a-4705-ac36-3bc217e514ec","resolution":{"observed_at":"2026-08-06T19:43:56.424226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.210094Z","title":"Speech Synthesis with Mixed Emotions,","venue":null,"work_id":"57e789a9-1d6a-47f0-abf1-63292937b7df","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.910644Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:3f4f134bd622d5a59f2e5620cb48fa3287580cb3fc64fed325092bfe06e19d0c","observation_id":"d6bc563d-2349-447a-bc8c-bcf0cbf2d8a2","resolution":{"observed_at":"2026-08-06T19:43:56.274757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.042599Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"604e61c8-033b-413c-a02f-d02efbb62fcc","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:55.007663Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:822a140e180072ca08ba083f17f62664780a75ec115256395a3d484fd1df5523","observation_id":"a0b1a794-6b15-4fdf-ba98-645d325cf3c2","resolution":{"observed_at":"2026-08-06T19:43:56.108651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.911491Z","title":"Sequence-to-Sequence Moelling OF F0 For Speech Emotion Conversion,","venue":null,"work_id":"3387a1b3-a79d-48fe-b45c-3d4fb19a3cf6","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:55.149647Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:b13e59196c73c6be14f8413407cdd5adf31a8dea47ec7952ef595e05c42eacf4","observation_id":"58f9026d-b06a-4b57-b1fe-a0b5f942f944","resolution":{"observed_at":"2026-08-06T19:43:55.983227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":3,"verified_fuzzy":45},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2507.04817."}