{"as_of":"2026-08-08T08:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:788aa18e5ef26fcf6d4d961b867cea7bedfaa65c25426a74675b6c560cb75e7f","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:56:27.098917Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:56:24.413325Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:56:27.602379Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"cited_work":{"arxiv_id":"2506.01032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01032","snapshot_observed_at":"2026-08-07T11:56:27.602379Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","venue":"cs.SD","work_id":"0378734f-d0e5-4aca-acea-0284b1e6b425","year":2025},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.413325Z"},"links":{"cited_paper":"/paper/2506.01032","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:0883c8be199b8d4f338cadb7e78fc4cdc3345b5b38ff62dff33794b68fdb7e33","observation_id":"69be4a59-e668-404b-a959-0208d6ea4ba8","resolution":{"observed_at":"2026-08-07T11:56:27.654727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01032/citation-record","integrity":"/paper/2506.01032/integrity","json":"/paper/2506.01032/citation-record.json","paper":"/paper/2506.01032"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.570582Z","title":"VC achieves this by decom- posing the source speech into different components, including the speaker’s timbre, linguistic content, and speaking style","venue":null,"work_id":"de70dc83-f976-49e5-a3be-01c397b0f3b5","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.323895Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:9f2343f1cb5ec71274558416e2a92b05c7a56bdb51f8d028ec968d4e793ee98a","observation_id":"158cdc83-d220-4cb2-ab56-b8a8d5c7bfab","resolution":{"observed_at":"2026-08-07T11:56:30.692554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"cited_work":{"arxiv_id":"2506.01032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01032","snapshot_observed_at":"2026-08-07T11:56:27.602379Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","venue":"cs.SD","work_id":"0378734f-d0e5-4aca-acea-0284b1e6b425","year":2025},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.413325Z"},"links":{"cited_paper":"/paper/2506.01032","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:0883c8be199b8d4f338cadb7e78fc4cdc3345b5b38ff62dff33794b68fdb7e33","observation_id":"69be4a59-e668-404b-a959-0208d6ea4ba8","resolution":{"observed_at":"2026-08-07T11:56:27.654727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.414094Z","title":"Encoder The encoder consists of an average voice encoder, Hubert-Soft [16], a speaker encoder, VQ-V AE, and a feature fusion mod- ule","venue":null,"work_id":"e5750802-9e74-4a7b-bb20-93a6ae558700","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.521096Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:18ecb74e81f5d24289bb076d9d92807a81d47f2d04203eb5dca8e7ae5e53288c","observation_id":"8763bd55-c397-4e4a-bcbb-0062d7ec033f","resolution":{"observed_at":"2026-08-07T11:56:30.467818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.218649Z","title":"Experimental Setup 4.1.1","venue":null,"work_id":"c9a5685f-fa5b-4fed-9a32-580edb1ec63d","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.629403Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:a2e6a1c9b8c312b41b1f9586bf50b67b182d0a1193b17076b12c4afec19342b5","observation_id":"b7e91cae-e49c-44a7-ae4c-271eb0f272ee","resolution":{"observed_at":"2026-08-07T11:56:30.324358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.900928Z","title":"ReFlow-VC can use the RK45 ODE solver for sampling, generating speech samples with optimal audio quality","venue":null,"work_id":"c5493e0e-80f5-4bb0-a97b-5f14a0ceb60d","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.842396Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:f3a9dfd537766520f6a18a266fb8a495b0ee81c636cdff5f27a5120e737747ea","observation_id":"214678d2-8aab-467c-bd48-621e47d7748f","resolution":{"observed_at":"2026-08-07T11:56:29.973300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.737453Z","title":null,"venue":null,"work_id":"768fe550-d0b9-4dab-92ec-44998b03127a","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.913275Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:d94bc6c0b8707b0defe70037a3c4b1fc1ed0d91ac4a170b87cb9220c17dadd84","observation_id":"2c21e631-8391-41b6-87f9-6ff5ca67a700","resolution":{"observed_at":"2026-08-07T11:56:29.818998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.024372Z","title":"Cyclegan-vc: Non-parallel voice conversion using cycle-consistent adversarial networks,","venue":null,"work_id":"a90c7846-337e-496d-b3d5-fa00adcf93a3","year":2018},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.509024Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:516d5879bc03f73e04f4975b61308225f60d59ceeb693441ceef5429221d5ff0","observation_id":"28da9560-8bcd-4632-8b2f-249b729ee5b5","resolution":{"observed_at":"2026-08-07T11:56:29.091663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.611013Z","title":"Privacy and utility of x-vector based speaker anonymiza- tion,","venue":null,"work_id":"ac5e7d99-52a6-4a8f-9988-1d553ab169a4","year":2022},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.990199Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:e18ebb7d8b9c4b5ff0aa6fb17626dca27965ad43aa4ce9666c5b783fc53ebd98","observation_id":"0eb97054-3189-4fd1-9061-82c2693a45dc","resolution":{"observed_at":"2026-08-07T11:56:29.673659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.440193Z","title":"Autovc: Zero-shot voice style transfer with only au- toencoder loss,","venue":null,"work_id":"7509ca68-18c4-40f1-b9ac-25427fb806f2","year":2019},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.063692Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:8a7ce9840b1d494ffed2716be54226e879a3681523cc1a8d7e0bd8532261aef3","observation_id":"df061bb7-9505-4c24-8407-c1c6e5f21e89","resolution":{"observed_at":"2026-08-07T11:56:29.532141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.301039Z","title":"Again-vc: A one-shot voice conversion using activation guidance and adap- tive instance normalization,","venue":null,"work_id":"5081e933-679e-4e7e-8094-1a9f8f2d05a1","year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.156702Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:f611be257ec7e1d5f8881a3f1fa52228f615a6faaad1248dcdef4ae3224d5799","observation_id":"80818db0-09fb-488f-a04c-02b757355f6f","resolution":{"observed_at":"2026-08-07T11:56:29.365146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.176497Z","title":"Gemo-clap: Gender-attribute-enhanced contrastive language- audio pretraining for accurate speech emotion recognition,","venue":null,"work_id":"9ab9f171-68fc-4b91-a1f3-06a6008c2be1","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.265163Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:287357bb9d048b99d4d4092862e606fdbe96c08cdbb545fbdeeb14932fb8f47b","observation_id":"e1309a94-e214-4b1d-a623-e2da6f4363b6","resolution":{"observed_at":"2026-08-07T11:56:29.214321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.340534Z","title":"Ace- vc: Adaptive and controllable voice conversion using explicitly disentangled self-supervised speech representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.340534Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:4d479a64f0d2e7002b8674a4004ddbbdf53ad7856603c525e4448dbbd51849b0","observation_id":"66734f72-d119-4c2b-beb2-523cbe00f4cf","resolution":{"observed_at":"2026-08-07T11:56:25.340534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10185","last_updated":"2019-07-24T00:37:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-24T00:37:20Z","title":"Non-Parallel Voice Conversion with Cyclic Variational Autoencoder","version":1},"cited_work":{"arxiv_id":"1907.10185","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.10185","snapshot_observed_at":"2026-08-07T11:56:27.474999Z","title":"Non-Parallel Voice Conversion with Cyclic Variational Autoencoder","venue":"eess.AS","work_id":"029cc54c-1cec-4597-a17b-169a47def217","year":2019},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.416182Z"},"links":{"cited_paper":"/paper/1907.10185","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:15852f27670e6a6ad61c4f0dd1ac14f5ea9e2f36f496a4b3f38a214f18607a65","observation_id":"701efda3-043e-4175-b5f6-48add114b86f","resolution":{"observed_at":"2026-08-07T11:56:27.522823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.278428Z","title":"Dddm-vc: Decoupled denoising diffusion models with disentangled representation and prior mixup for verified robust voice conversion,","venue":null,"work_id":"a9e370ad-4216-41dd-8a8c-a9d1b934dea1","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.082385Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:69124e1b6562773886fa885e187ccf09e0ceb4b83f83fe3534e6a24b017b08e8","observation_id":"40ae660b-ea3c-4806-8810-6cd872c68837","resolution":{"observed_at":"2026-08-07T11:56:28.366411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.900738Z","title":"Generative adver- sarial networks,","venue":null,"work_id":"83d0933b-767b-4e5f-8934-0c3e20c2bb4c","year":2020},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.598126Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:b6a22e17d16a24db0133ba9d397a084ce66a8cbca747b05ffc9fba799a570aa9","observation_id":"bb5b6982-d170-4ed8-a8ab-544c7620bf09","resolution":{"observed_at":"2026-08-07T11:56:28.951288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.758422Z","title":"Cyclegan- vc2: Improved cyclegan-based non-parallel voice conversion,","venue":null,"work_id":"2c2f79af-b9e9-48e5-8c63-cff486735f18","year":2019},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.685267Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:9a49d826564df1c38323b7b3c822cec1de171942d965991863bd864b5dd4ba23","observation_id":"a96ced03-f733-47c7-a74b-9fee0d0d6d07","resolution":{"observed_at":"2026-08-07T11:56:28.834699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.646818Z","title":"Stargan-vc: Non-parallel many-to-many voice conversion using star genera- tive adversarial networks,","venue":null,"work_id":"fb8829cf-9383-4d5b-a13d-44bcbf88bdac","year":2018},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.776761Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:d1477580d6c0eddb1770764d4344deefb4744eeb059f22f4aceba370a918a07d","observation_id":"9b49f441-e0fc-47d6-8be7-6755a0ed9354","resolution":{"observed_at":"2026-08-07T11:56:28.693746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.869060Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.869060Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:113d793b84e2ab9f3ec3d99f69373f8244a67ae87fd067392de3c7267df1dfb1","observation_id":"978f9bfe-4495-4704-ab32-ee00eefd0404","resolution":{"observed_at":"2026-08-07T11:56:25.869060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-07T17:24:03.888611Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-07T11:56:25.936184Z","title":"Diffusion-based voice conversion with fast maximum likelihood sampling scheme,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.936184Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:e82871c1362095d6f376b558aabdf6a07f872e1b21fe9c9af364c0e402bef913","observation_id":"e638bdbd-8655-4859-a950-a8396c317d62","resolution":{"observed_at":"2026-08-07T11:56:25.936184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.446159Z","title":"Reflow-tts: A rectified flow model for high-fidelity text-to- speech,","venue":null,"work_id":"afb56f5a-0e11-4f17-b265-7138e4b11d51","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.015110Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:b15abac44b190c21f3d840414855058ee6df96d146f5b62cf8e9acf140baac6e","observation_id":"ee4c4c4e-bc66-4e03-85c4-c51a34b6626a","resolution":{"observed_at":"2026-08-07T11:56:28.509039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:26.685169Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.685169Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:12194e81f6ab274a1395a43696b5c7cc290174ae9bba76c9c0aafa75832cd3ae","observation_id":"648d8f50-cf54-4332-bcc3-d15ef3efed28","resolution":{"observed_at":"2026-08-07T11:56:26.685169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T11:56:26.164721Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.164721Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:5dfcc8b055465ee158b5704798258e11966878f1d5fa4015d016203b85188715","observation_id":"67d80638-dbdc-4918-9e78-f9346234f4e4","resolution":{"observed_at":"2026-08-07T11:56:26.164721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.103253Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"5a5e3028-d4c4-4f52-af5f-50160d2ab577","year":2022},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.250848Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:88c1320e4dc15e8e4137d3f43f6fa241d50f5f9e55ebf78198d03b4bb3f39220","observation_id":"4cbd47af-8a34-42eb-b285-8f5ca317a065","resolution":{"observed_at":"2026-08-07T11:56:28.188153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-07-06T10:55:38.166742Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-07T11:56:26.345966Z","title":"Speech resynthesis from dis- crete disentangled self-supervised representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.345966Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:0841ca397366f2835893ad39e2590aaffdf3874f5635295b442c5b1dc6464ee3","observation_id":"eeebdec5-02a3-4389-bf12-bc264f94427c","resolution":{"observed_at":"2026-08-07T11:56:26.345966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04416","last_updated":"2025-01-08T11:04:30Z","snapshot_observed_at":"2026-08-03T18:09:50.962834Z","submitted_at":"2025-01-08T11:04:30Z","title":"ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04416","snapshot_observed_at":"2026-08-07T11:56:26.433423Z","title":"Zsvc: Zero-shot style voice conversion with disentangled la- tent diffusion models and adversarial training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.433423Z"},"links":{"cited_paper":"/paper/2501.04416","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:3f28e9dd8136124e0b4af9c622f597fafa28190d967e9777b6da63db408bf258","observation_id":"c3b103a8-05ae-4853-9180-1373feef1466","resolution":{"observed_at":"2026-08-07T11:56:26.433423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02026","last_updated":"2025-08-10T04:48:33Z","snapshot_observed_at":"2026-07-06T19:44:47.582139Z","submitted_at":"2024-11-04T12:23:17Z","title":"Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":"2411.02026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02026","snapshot_observed_at":"2026-08-07T11:56:27.271513Z","title":"Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching","venue":"cs.SD","work_id":"86044218-fbf3-4e65-a13c-a802e481c640","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.530413Z"},"links":{"cited_paper":"/paper/2411.02026","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:b0ffe8a7cc1c332819f61f29c134c3593e9abf5b6ab2a01c2c5892e756090420","observation_id":"d100de23-1730-49a4-be1d-62572a48914d","resolution":{"observed_at":"2026-08-07T11:56:27.320718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.926499Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"7eccc510-9055-48ba-9708-a87a2f372e13","year":2015},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.592381Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:4262faabef3fc056447b3e587de7c9547fa4c6178a1b9f99f6ee58cb1a31d7ac","observation_id":"aafa886a-6d5b-453d-a6df-d92b310798d3","resolution":{"observed_at":"2026-08-07T11:56:27.997312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T11:56:26.818986Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.818986Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:4566652293ab99dcf77ab688f7e2830f259560c86db665850848c1e1be314194","observation_id":"725c1408-5ac8-4947-b6b7-9fed0b823b63","resolution":{"observed_at":"2026-08-07T11:56:26.818986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T11:56:26.905749Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.905749Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:1349f8a9a56507d17f6906dfa249bcc84cc1fc05b4dd8ef10a92c4fb1181afab","observation_id":"007dcde5-8537-43e9-adf3-a5132140a35c","resolution":{"observed_at":"2026-08-07T11:56:26.905749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.003061Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:27.003061Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:166945132c75b26e5e80f27a19cefccb8af5562de25e3d2fddd53422bf99f2e7","observation_id":"70ef9325-7ef1-4873-8941-4c56aaa07e6c","resolution":{"observed_at":"2026-08-07T11:56:27.003061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.733300Z","title":"Whis- per: Tracing the spatiotemporal process of information diffusion in real time,","venue":null,"work_id":"eda81d66-02b2-4455-922e-9535b944eb6a","year":2012},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:27.098917Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:e40b8832da04cffc86c232f382c812cb2d9dc9cc829488f00a1a1bd514db1b65","observation_id":"76c56840-f1ae-4dd0-97f8-ab290b59047d","resolution":{"observed_at":"2026-08-07T11:56:27.801674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.054393Z","title":"We used the pre-trained HiFi-GAN [24] as the neural vocoder, which is responsible for converting the mel spectrograms into raw wave- forms","venue":null,"work_id":"4003b977-caa8-45b9-8d5b-5d5038f2c728","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.766859Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:1981c9fddc670223f0d4050b1c37fbb7ab40def1a3bd1083e1b0e7d100a5eaa5","observation_id":"df16ac5d-54a6-46aa-9e59-cf858949d778","resolution":{"observed_at":"2026-08-07T11:56:30.115942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":3,"verified_fuzzy":18},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2506.01032."}