{"as_of":"2026-08-07T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:604f5c0f18a5f8558b60236d85a1a73ec4f6b7960200ae3250eda388030bfc54","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:58.250585Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:58.165183Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:46:58.296609Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"cited_work":{"arxiv_id":"2506.09709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09709","snapshot_observed_at":"2026-08-07T04:46:58.296609Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","venue":"cs.SD","work_id":"73d3b41a-bc38-490b-8c78-154a9af597ca","year":2025},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.165183Z"},"links":{"cited_paper":"/paper/2506.09709","citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:f2500195ecbfd97c32a7dd1ff1c5b4192add9d747a88551e76fa5884fc36f7b9","observation_id":"040479bc-4fb1-427b-bb1f-7fef9fdae6e1","resolution":{"observed_at":"2026-08-07T04:46:58.300939Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09709/citation-record","integrity":"/paper/2506.09709/integrity","json":"/paper/2506.09709/citation-record.json","paper":"/paper/2506.09709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"cited_work":{"arxiv_id":"2506.09709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09709","snapshot_observed_at":"2026-08-07T04:46:58.296609Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","venue":"cs.SD","work_id":"73d3b41a-bc38-490b-8c78-154a9af597ca","year":2025},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.165183Z"},"links":{"cited_paper":"/paper/2506.09709","citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:f2500195ecbfd97c32a7dd1ff1c5b4192add9d747a88551e76fa5884fc36f7b9","observation_id":"040479bc-4fb1-427b-bb1f-7fef9fdae6e1","resolution":{"observed_at":"2026-08-07T04:46:58.300939Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.519589Z","title":"analysis- mapping-reconstruction","venue":null,"work_id":"6ff90bc5-fbd8-48a2-a88c-999be408e849","year":2024},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.169685Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:908cf036040f61b398be660e0113114edadb17aca923bcce73cad6c6df27df17","observation_id":"360c8022-259e-4105-8ed0-9cbdb0680580","resolution":{"observed_at":"2026-08-07T04:46:58.523235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02402","last_updated":"2024-10-17T22:48:53Z","snapshot_observed_at":"2026-08-07T17:12:48.861597Z","submitted_at":"2024-10-17T22:48:53Z","title":"Optimal Transport Maps are Good Voice Converters","version":1},"cited_work":{"arxiv_id":"2411.02402","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02402","snapshot_observed_at":"2026-08-07T04:46:58.278938Z","title":"Optimal Transport Maps are Good Voice Converters","venue":"cs.SD","work_id":"9a2328df-5f64-4ba2-a22a-88f1974262dd","year":2024},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.173480Z"},"links":{"cited_paper":"/paper/2411.02402","citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:30198f5beb215049fe5caeeaa326522d59d1c9c8d8680ae2b37abce21d25b12c","observation_id":"73d6c292-445b-4c6a-a824-89eadf556b10","resolution":{"observed_at":"2026-08-07T04:46:58.284954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.508002Z","title":"Datasets To evaluate any speaker to any speaker voice conversion we conduct our experiments on a LibriSpeech dataset [14], which consist of 40 speakers","venue":null,"work_id":"d8c61eed-6c5d-4461-a044-e767b80def14","year":null},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.177606Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:d690f4f627edfee9692578bc04e144e942c2b95952075ddf218ac64c7f8eeaf8","observation_id":"8bcd653a-ddc9-48c6-8226-94c308820865","resolution":{"observed_at":"2026-08-07T04:46:58.511920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.497102Z","title":"MKL stands for Monge-Kantorovich Linear map- ping and is based on the exact solution of the quadratic opti- mal transport problem for Gaussian distributions","venue":null,"work_id":"b25f89a4-74ca-4bdd-9130-fc63c5ff7ca4","year":null},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.181674Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:c86c8f77940d5405ae565a3e1a29d36c1d5df7d8ee3aa465612dae74007b83da","observation_id":"f8abe61b-d45d-4d92-85e6-cdfe9069b44c","resolution":{"observed_at":"2026-08-07T04:46:58.500750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.485486Z","title":"To prevent misuse, it is crucial to develop robust speech detection methods and avoid voice authentication in high-security applications","venue":null,"work_id":"2f4aca5e-9551-4e85-b7f9-c9a1d80acd58","year":null},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.185471Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:9acb7a025e6cd2087a897f7ee31200fccce5a56efec020d26bfc3b632f69624f","observation_id":"c3fee13e-6d95-498d-b30d-5cb176e681fb","resolution":{"observed_at":"2026-08-07T04:46:58.489573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.474270Z","title":"An overview of voice conversion and its challenges: From statistical modeling to deep learning,","venue":null,"work_id":"5e3ab416-533d-4ecb-b9b8-6657bdc80e1d","year":2020},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.189231Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:933a7e4cc26f065ab0a3ae85e88836fe0a768601a0942347367c05d0ada9bf1d","observation_id":"5cc02536-5603-45c2-8073-e49e2202bf7a","resolution":{"observed_at":"2026-08-07T04:46:58.478706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.463577Z","title":"V oice conversion with just nearest neighbors,","venue":null,"work_id":"56719cbc-3dca-481a-968d-3509f4b9496f","year":2023},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.192739Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:2a5805d2b6b0a93e9778a4b2afc428affe097386544eb63e394f6dec2598d8ca","observation_id":"03efe944-c0f5-4f77-899c-913b8f637817","resolution":{"observed_at":"2026-08-07T04:46:58.467170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.196130Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.196130Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:3d3beff8b806c1b69a48110e28673da8ec073a776f912631a6f8dac01764a86f","observation_id":"15d04ac7-e848-4a4a-b116-1f16a1d0e708","resolution":{"observed_at":"2026-08-07T04:46:58.196130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.446178Z","title":"Overview of voice conversion methods based on deep learning,","venue":null,"work_id":"03faad29-18c8-464b-9560-3471c8a1be3f","year":2023},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.199652Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:deae8687dba3ea291bc60d6f936ecfdea1323da5ed3b8f43827815b5afce99e9","observation_id":"8e17d4bb-7b97-44f3-8607-9b8ff4e6d14a","resolution":{"observed_at":"2026-08-07T04:46:58.450108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.434959Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":"3b06c5d0-8149-4db2-9bfd-bf1d89c8cb82","year":2024},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.203015Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:5db2368438069c2519dd89df7d9df6366903a1a4064426699885ca57c103fe13","observation_id":"f5bfd163-ef5e-479c-b208-0f64fbd446b6","resolution":{"observed_at":"2026-08-07T04:46:58.438863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.424122Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":"8e25d006-3e1b-427d-bfd5-ffad0856c5af","year":2023},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.206415Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:8c359367dfb7581c4404fcd484db764da345c1c31373f7655c12a8e468a21ac1","observation_id":"01d2ddd3-d4ae-4af4-8562-51d50b27117c","resolution":{"observed_at":"2026-08-07T04:46:58.427879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.209925Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.209925Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:35dc9bf3bdc4da63f5fd9fe0e9e488f4ee5d0a9d97ac921b12c63aba841bf856","observation_id":"cf068a00-5400-42b7-9bf0-71432c187458","resolution":{"observed_at":"2026-08-07T04:46:58.209925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.406123Z","title":"Diffusion-based voice conversion with fast maxi- mum likelihood sampling scheme,","venue":null,"work_id":"196f3474-eadb-4190-9f55-8ae0c6252602","year":2022},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.213250Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:2b7159be87d80cd72fe8c16459ca5f8ecf744144d35c914e3cc11699b9644c1a","observation_id":"bf7e626e-ec35-4540-b765-de1997883652","resolution":{"observed_at":"2026-08-07T04:46:58.409817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.394910Z","title":"Vqmivc: Vector quantization and mutual information-based un- supervised speech representation disentanglement for one-shot voice conversion,","venue":null,"work_id":"61097213-2543-4ecc-904a-95fcc1012914","year":2021},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.216996Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:6c8bd4c123b61b40dd3a444f452acf9e879d2a71dc76ba4f0fc78292055b45d1","observation_id":"80a1c7c7-9caf-4141-a0aa-f18e494756f1","resolution":{"observed_at":"2026-08-07T04:46:58.399176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.384163Z","title":"Synthesizing a choir in real-time using pitch synchronous over- lap add (psola)","venue":null,"work_id":"760741c1-e228-4ad6-8c9d-4a9a62faff18","year":2000},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.220290Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:f7133ab8ec913b58204cbab57277b29bbe399d059d7217dd029e486ac73d1432","observation_id":"ed234397-fd74-426d-ac2f-34b63a62122d","resolution":{"observed_at":"2026-08-07T04:46:58.388146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.223576Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.223576Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:eaa69cee7462cc1a4a5620613a2f8e1ad7ca1a1910d389ffc43123ba8b1b66c0","observation_id":"fa222018-5511-4844-9a06-a4925f9b3950","resolution":{"observed_at":"2026-08-07T04:46:58.223576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.367509Z","title":"Sinkhorn distances: Lightspeed computation of op- timal transport,","venue":null,"work_id":"eb6aae98-947c-4d12-8a87-fdbed51f3ae3","year":2013},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.226853Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:b68af5489abf1a1135ded688221434e00844c3808e3d727324defcf15ac1b446","observation_id":"ca7b0d54-dcbc-45ee-9077-35609d1e7e7d","resolution":{"observed_at":"2026-08-07T04:46:58.371130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.230241Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.230241Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:aa23f3de900a4f6b2476ed588d222416b107d87c2d0abc6e604fa0fb28909c2f","observation_id":"7a1909ea-d35a-46c2-bd93-8bca21ef8fa2","resolution":{"observed_at":"2026-08-07T04:46:58.230241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.233596Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.233596Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:98839701e7905f87ab66d8e6561eacdb3a1a299414852fca530a1506bdea9feb","observation_id":"516dea9b-38ca-45e5-b662-3994b5bd404f","resolution":{"observed_at":"2026-08-07T04:46:58.233596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.343865Z","title":"The linear monge-kantorovitch linear colour mapping for example-based colour transfer,","venue":null,"work_id":"f981b013-c061-4b57-b18a-c0bc731f3216","year":2007},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.237365Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:d87387f1ae3b5f3eaa1d16038a203904ed8df776c8046463ddbfba2a30abd2b5","observation_id":"a5626f5b-bc48-49e9-982c-e8c3d65a2e77","resolution":{"observed_at":"2026-08-07T04:46:58.347565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.240867Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.240867Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:1d7bc10aad4e4e9f9597657622c622f0119394ea8cd74a61817e7deda236e2c7","observation_id":"136742ef-6804-4aec-b0ed-fb867687741d","resolution":{"observed_at":"2026-08-07T04:46:58.240867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.326194Z","title":"Spoken language recognition using x-vectors","venue":null,"work_id":"6f95af85-271f-4567-9567-3fa1e8e90f65","year":2018},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.244049Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:e31972d54a6a4853a5f9e02a847bcd3e77d4406674f23d881f4566d36b3d50a7","observation_id":"d08e3d2c-0d1d-4693-a9db-2cb833fbcf80","resolution":{"observed_at":"2026-08-07T04:46:58.329876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.247356Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.247356Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:5a17105e9441ecc13e37f0aaa4be2d3e4d763be773d4007f41e8fa4c1b746c9c","observation_id":"0627924d-96b0-444e-ad3d-de298300a310","resolution":{"observed_at":"2026-08-07T04:46:58.247356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:58.308255Z","title":"Moseley,Atlas of the World’s Languages in Danger","venue":null,"work_id":"88274b21-672a-430b-9f62-e67975e485a7","year":2010},"citing_paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:58.250585Z"},"links":{"citing_paper":"/paper/2506.09709"},"observation_digest":"sha256:850ef98c6c3e6a3ecb2f8132cd9e1c2114373b382cfe436a982143a58bbb3d45","observation_id":"36b41260-1266-4bca-99de-4a7b79dfdc52","resolution":{"observed_at":"2026-08-07T04:46:58.311979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09709","last_updated":"2025-06-11T13:23:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T04:39:58.602548Z","submitted_at":"2025-06-11T13:23:03Z","title":"Training-Free Voice Conversion with Factorized Optimal Transport"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2506.09709."}