{"as_of":"2026-08-07T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7850d5cdf41e73f0dbd8be02922f06aca1860afd4a09e6694c23870492f6fc6a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:20:56.553076Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08348/citation-record","integrity":"/paper/2506.08348/integrity","json":"/paper/2506.08348/citation-record.json","paper":"/paper/2506.08348"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.208254Z","title":"V oice conversion based on maximum-likelihood estimation of spectral parameter trajectory,","venue":null,"work_id":"62018eaf-bfa2-4679-9ae8-0ef42a2c8bba","year":2007},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.349680Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:a73913c67c2b942388e22cfc1aa9faba747f29de841166ba68fb80359e9e11a8","observation_id":"984f4d4e-e765-4b3e-bddd-41082157cc25","resolution":{"observed_at":"2026-08-07T05:20:57.213088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.191546Z","title":"V oice conver- sion using partial least squares regression,","venue":null,"work_id":"30fa58bf-4dc6-4310-91c1-96d4ed52c91c","year":2010},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.355241Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:3c72d8412f8fc280d2ffba04b04f0aed44c1aa214168ef115bb0ac26f91881a0","observation_id":"054c55bf-929c-4d75-9be2-50d73c02b065","resolution":{"observed_at":"2026-08-07T05:20:57.197580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.175202Z","title":"One-shot voice conversion by vector quan- tization,","venue":null,"work_id":"e04d2721-d499-4aa0-b2a1-d87d87b40fcf","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.360386Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:68784df084662ceb11ffe56fce527fd74b9cc61f9a2fea24f608c5280f99b6f2","observation_id":"48862db6-524c-441e-b0b7-e5c886434783","resolution":{"observed_at":"2026-08-07T05:20:57.180600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.159001Z","title":"V oice conversion based on weighted frequency warping,","venue":null,"work_id":"2f613076-fca9-47e7-8272-faf42962a7bc","year":2009},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.365278Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:57b91a9c7ebe12d0953c324e81848895cd0e581fde089a730a0ffde59a340b94","observation_id":"0aaf1b13-36fa-458c-9b41-7c18fcc01b62","resolution":{"observed_at":"2026-08-07T05:20:57.163946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.143867Z","title":"Exemplar-based emotional voice conversion using non-negative matrix factorization,","venue":null,"work_id":"eae99c0f-ad12-455e-8cd0-59583b011047","year":2014},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.370718Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:680d42f09a848beaf4ead13b65d6bf4043546d44cfe3e438dee72e641bd480a2","observation_id":"7dd43c19-8577-43fc-bbfb-7186634612d4","resolution":{"observed_at":"2026-08-07T05:20:57.148796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11672","last_updated":"2020-10-22T13:08:44Z","snapshot_observed_at":"2026-07-06T10:07:11.545571Z","submitted_at":"2020-10-22T13:08:44Z","title":"CycleGAN-VC3: Examining and Improving CycleGAN-VCs for Mel-spectrogram Conversion","version":1},"cited_work":{"arxiv_id":"2010.11672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.11672","snapshot_observed_at":"2026-08-07T05:20:56.868423Z","title":"CycleGAN-VC3: Examining and Improving CycleGAN-VCs for Mel-spectrogram Conversion","venue":"cs.SD","work_id":"bca0b3fb-306f-4916-9469-56cd836f3a1d","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.376682Z"},"links":{"cited_paper":"/paper/2010.11672","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:7b6931c8847cdc875686d15bcd06c96771eaf718a7896c38ad40e3496c93fc95","observation_id":"da33dfc8-5ad9-48d6-9fee-b5b8abee40f6","resolution":{"observed_at":"2026-08-07T05:20:56.874154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.127351Z","title":"Maskcyclegan-vc: Learning non-parallel voice conversion with filling in frames,","venue":null,"work_id":"e11c7c68-bd05-4809-a4f0-f475a272576d","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.382682Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:19e29eb3809df6be52879d03ac8fba358f3a94ea2c2ce656465985fa0dc8fef8","observation_id":"99f28df6-a2f3-472d-a176-31048a0dd276","resolution":{"observed_at":"2026-08-07T05:20:57.132574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.112268Z","title":"Stargan-vc: Non- parallel many-to-many voice conversion using star generative adversarial networks,","venue":null,"work_id":"74aebe66-c889-412d-9821-24cc7c2317d1","year":2018},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.387162Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:ad7713f0854799905e999f3475ff4a2652855aaca4d2635000f45209df323cf4","observation_id":"9d67a24d-2905-4074-ab9a-045b33805422","resolution":{"observed_at":"2026-08-07T05:20:57.117039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12279","last_updated":"2019-08-07T10:21:30Z","snapshot_observed_at":"2026-07-06T08:10:51.630781Z","submitted_at":"2019-07-29T08:51:52Z","title":"StarGAN-VC2: Rethinking Conditional Methods for StarGAN-Based Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12279","snapshot_observed_at":"2026-08-07T05:20:56.392760Z","title":"Stargan-vc2: Rethinking conditional methods for stargan-based voice conversion,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.392760Z"},"links":{"cited_paper":"/paper/1907.12279","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:aa01230881bd91b912a700920c5f8937d3b2707573abc2f8dedf194aba65c527","observation_id":"4fd6335c-3a3c-4aa9-a103-f53bfce22d4e","resolution":{"observed_at":"2026-08-07T05:20:56.392760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10394","last_updated":"2021-07-23T01:08:09Z","snapshot_observed_at":"2026-07-06T11:31:23.057674Z","submitted_at":"2021-07-21T23:44:17Z","title":"StarGANv2-VC: A Diverse, Unsupervised, Non-parallel Framework for Natural-Sounding Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10394","snapshot_observed_at":"2026-08-07T05:20:56.397656Z","title":"Starganv2-vc: A diverse, unsuper- vised, non-parallel framework for natural-sounding voice conversion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.397656Z"},"links":{"cited_paper":"/paper/2107.10394","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:8e853c76f6681dcdae57f25ce8ceef8b0c997e8ff253bc730f047e27664d99c4","observation_id":"d4189bac-1350-46ff-b3c3-a060f636ea3f","resolution":{"observed_at":"2026-08-07T05:20:56.397656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.097061Z","title":"Towards low-resource stargan voice conversion using weight adaptive instance normalization,","venue":null,"work_id":"c0eeae04-86f0-4fb0-991f-478f8637a266","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.402598Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:c2bd5e9a5615f84801e467d5b184809d6d473b084c69fcca9886d49abdaee820","observation_id":"a4ce5873-37db-4adb-91f5-c3925145d518","resolution":{"observed_at":"2026-08-07T05:20:57.102161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.407074Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.407074Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:4a683cd00641aac4b29906083c19f8a42b5fe8ab01c1c3923024c0085d2b31a2","observation_id":"95a0c7a2-16a0-43e5-8868-16dd187b3eeb","resolution":{"observed_at":"2026-08-07T05:20:56.407074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.412130Z","title":"Analyzing and improving the image quality of stylegan,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.412130Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:5f8c5fd144c8f8be9dca62f10741d46dc3ad437a77260d9254483c3747f36af8","observation_id":"10f13ce0-a278-4900-bacc-a351945f680b","resolution":{"observed_at":"2026-08-07T05:20:56.412130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.059173Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"7c50c522-5428-4a85-a768-cacf723e327c","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.416818Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:19f3d35ccd0aa1b50d0f348654c5c4bf68f881d43396129567cc94071f89dce3","observation_id":"34ddbf14-51fb-4147-9c04-1ad48ea6fac2","resolution":{"observed_at":"2026-08-07T05:20:57.065026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.421720Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.421720Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:837ef6a4292cebb9ddc03588e9bcdf9fef8ddfce2d35ba8c28465c4d6207ccd5","observation_id":"a7b46ca5-8135-40cc-bd41-a523363454e1","resolution":{"observed_at":"2026-08-07T05:20:56.421720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18975","last_updated":"2023-05-30T12:19:07Z","snapshot_observed_at":"2026-07-06T15:35:22.185803Z","submitted_at":"2023-05-30T12:19:07Z","title":"Voice Conversion With Just Nearest Neighbors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18975","snapshot_observed_at":"2026-08-07T05:20:56.427227Z","title":"V oice conversion with just nearest neighbors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.427227Z"},"links":{"cited_paper":"/paper/2305.18975","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:bef22d33fb430c71c2c021bfc04c45725daf845f10f00ef31972e7e2b897f547","observation_id":"2cec32e6-62f1-4393-ba0b-46bceb591cd6","resolution":{"observed_at":"2026-08-07T05:20:56.427227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.432228Z","title":"Unsupervised speech decomposition via triple information bottleneck,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.432228Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:16cc60a1eb3d954e32acb4d889767ed09cc58363adb5708289629fc143ea2c71","observation_id":"08562dc7-af3a-4d64-b812-abe8067c4944","resolution":{"observed_at":"2026-08-07T05:20:56.432228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.021504Z","title":"Speech- split2. 0: Unsupervised speech disentanglement for voice conversion without tuning autoencoder bottlenecks,","venue":null,"work_id":"df7bab6a-cfc4-43a7-b947-f9b84e3b87c9","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.436825Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:171b44e52a2529303a467124658b2105148acb964ac519959390ba654adbbdc8","observation_id":"51267e6b-de04-4351-b386-8eac3f0f5689","resolution":{"observed_at":"2026-08-07T05:20:57.026704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05742","last_updated":"2019-08-22T17:18:16Z","snapshot_observed_at":"2026-07-06T07:45:28.742612Z","submitted_at":"2019-04-10T16:22:18Z","title":"One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05742","snapshot_observed_at":"2026-08-07T05:20:56.441589Z","title":"One-shot voice conversion by separating speaker and content representations with instance normaliza- tion,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.441589Z"},"links":{"cited_paper":"/paper/1904.05742","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:21cc1540b13363a5835d6dd6a0e114e38a04070a23e09afa4174d434c8f120f6","observation_id":"d4206615-b39a-45e5-96a6-7b9b54315815","resolution":{"observed_at":"2026-08-07T05:20:56.441589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.446819Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.446819Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:80bf225cf9c0cb42faeed203c35b8ca8ed03779a2f0bfbd9d6a477acd951bccb","observation_id":"389d9cb2-3bb7-4c5f-9f84-436da54614bb","resolution":{"observed_at":"2026-08-07T05:20:56.446819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T05:20:56.451555Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.451555Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:2de0836b772edec197db06b0ca5458071d6d9a507e4a39985f8470adefd4c130","observation_id":"9d099ae3-f46a-4463-bb50-feaf6ed86116","resolution":{"observed_at":"2026-08-07T05:20:56.451555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T05:20:56.456677Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.456677Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:d36d8f3b84cd70cbd5047ba099c74ddb2e4345df4b91b1d974a0474d3816741b","observation_id":"9d9b5c92-6c73-4621-bdb8-6ffb89b708d1","resolution":{"observed_at":"2026-08-07T05:20:56.456677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-07T05:20:56.462348Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.462348Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:88f561adce26dea609a647bcc9a3b200507fb447ac4cc4a92cb669c8c17dbb2e","observation_id":"2ddd568e-09ad-4df4-bd24-95be75ee1743","resolution":{"observed_at":"2026-08-07T05:20:56.462348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17746","last_updated":"2024-09-26T11:22:16Z","snapshot_observed_at":"2026-07-06T19:22:41.483499Z","submitted_at":"2024-09-26T11:22:16Z","title":"Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17746","snapshot_observed_at":"2026-08-07T05:20:56.467464Z","title":"Paraformer-v2: An improved non- autoregressive transformer for noise-robust speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.467464Z"},"links":{"cited_paper":"/paper/2409.17746","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:f8d4de0f6a96d909721dc16baeb88f2bcf4d8995a2b90e03f7b021f34e81fb1e","observation_id":"f57e56ba-f70a-43e0-83c3-5c082c7d1716","resolution":{"observed_at":"2026-08-07T05:20:56.467464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15249","last_updated":"2022-11-11T02:51:15Z","snapshot_observed_at":"2026-07-06T12:53:57.562834Z","submitted_at":"2022-03-29T05:48:24Z","title":"MFA-Conformer: Multi-scale Feature Aggregation Conformer for Automatic Speaker Verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15249","snapshot_observed_at":"2026-08-07T05:20:56.473419Z","title":"Mfa-conformer: Multi-scale feature aggregation conformer for automatic speaker verification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.473419Z"},"links":{"cited_paper":"/paper/2203.15249","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:3f694143dbd1998fc2565a1fdcad17ad14a5c1d299bc294722b546f0fd8f4bbe","observation_id":"1bbcee2d-6004-41b3-86a1-47a1d2b5ebb3","resolution":{"observed_at":"2026-08-07T05:20:56.473419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.994036Z","title":"Mfa: Tdnn with multi- scale frequency-channel attention for text-independent speaker verifi- cation with short utterances,","venue":null,"work_id":"1b982175-c247-4c07-9afd-bb0382b417c9","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.478268Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:1e6b4b56e73d0b4a5f9541697c2d27ef82ece1b013a3b7a651df8861de958a18","observation_id":"324d17f9-1a2f-48b8-a9b8-0a889100a81f","resolution":{"observed_at":"2026-08-07T05:20:57.000084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.977303Z","title":"Se-conformer: Time-domain speech enhancement using conformer","venue":null,"work_id":"6d3ffe19-1323-4464-80ae-1c153832f723","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.482746Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:47ba67d026405093edd08462fef1235c1af9ba5b58353222e6675c6acf5f95f6","observation_id":"97c410a0-8548-4920-b604-8548fbbec478","resolution":{"observed_at":"2026-08-07T05:20:56.982325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.960467Z","title":"Cmgan: Conformer-based metric- gan for monaural speech enhancement,","venue":null,"work_id":"e1a56fa7-8ec3-45f0-a9ea-7e1154fc26e4","year":2024},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.487609Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:22a968c6431fc40858de12c4702041bf88e9ea72daa67469a318d8bcc39fc30d","observation_id":"20ec24b6-256f-4d1e-a607-066b63aa2c4a","resolution":{"observed_at":"2026-08-07T05:20:56.966249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07737","last_updated":"2017-11-21T15:35:07Z","snapshot_observed_at":"2026-08-04T09:19:45.912586Z","submitted_at":"2017-03-22T16:34:29Z","title":"In Defense of the Triplet Loss for Person Re-Identification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07737","snapshot_observed_at":"2026-08-07T05:20:56.493364Z","title":"In defense of the triplet loss for person re-identification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.493364Z"},"links":{"cited_paper":"/paper/1703.07737","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:5ac99477ea37ccad35d9cdfd0077a48140b3d1b4b8bd4ced375c27ef31f60f36","observation_id":"e95fdbee-caad-4a3b-8b2b-630d24ef99ea","resolution":{"observed_at":"2026-08-07T05:20:56.493364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00930","last_updated":"2024-11-24T09:30:29Z","snapshot_observed_at":"2026-07-06T18:08:30.875909Z","submitted_at":"2024-05-02T01:11:15Z","title":"MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion","version":2},"cited_work":{"arxiv_id":"2405.00930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.00930","snapshot_observed_at":"2026-08-07T05:20:56.696846Z","title":"MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion","venue":"cs.SD","work_id":"9ac34d8a-6639-416f-992b-1129eb8d4615","year":2024},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.497984Z"},"links":{"cited_paper":"/paper/2405.00930","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:f251a8412e796b9ad0aa6049a3d0d37389777584b4a933fda2291d190ef93de3","observation_id":"6b72c4ae-d7bf-413b-a6e0-f593f4477a1e","resolution":{"observed_at":"2026-08-07T05:20:56.702013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.944371Z","title":"knn-svc: Robust zero- shot singing voice conversion with additive synthesis and concatenation smoothness optimization,","venue":null,"work_id":"326152db-22c6-42d8-82a2-1e96714112c5","year":2025},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.503106Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:5f25ecde0294c45ec88fa213b13ff4064b5c5594e0f7142652b824d567a81e39","observation_id":"1098f1f7-edd4-441d-ad11-d24b9d113d07","resolution":{"observed_at":"2026-08-07T05:20:56.949262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.926686Z","title":"A new spoken language teaching tech: Combining multi-attention and adain for one-shot cross language voice conversion,","venue":null,"work_id":"74f642fa-a906-4328-a351-4bc988a90f47","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.507605Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:9d3ad40e35c2d19feb4741030dbcf2ad5be54a2ab9541a6f70db33d5b417408e","observation_id":"9aa6b093-a4b5-4fd5-a3b1-b94c5a44c3e8","resolution":{"observed_at":"2026-08-07T05:20:56.932215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.910189Z","title":"Styleformer: Real-time arbitrary style transfer via parametric style composition,","venue":null,"work_id":"55dc93e9-d48a-45bd-9090-f1ef27604f83","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.512525Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:03038cf8f690300189415c9a0d75ca6673f06b9213771ee282df72b00f60f4ce","observation_id":"a7c9e42c-6d60-4c8c-90ec-947758a786a0","resolution":{"observed_at":"2026-08-07T05:20:56.915323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.517160Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.517160Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:6e69e7f52c7f91bb127bb13b038cd4d9d8f7cadf7ea869b74332dd8b7008894b","observation_id":"4f89271c-c861-4aa6-a42e-2758c06cb6a9","resolution":{"observed_at":"2026-08-07T05:20:56.517160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12585","last_updated":"2020-06-01T01:17:18Z","snapshot_observed_at":"2026-08-06T02:38:07.962906Z","submitted_at":"2020-04-27T05:20:01Z","title":"A Batch Normalized Inference Network Keeps the KL Vanishing Away","version":2},"cited_work":{"arxiv_id":"2004.12585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.12585","snapshot_observed_at":"2026-08-07T05:20:56.676168Z","title":"A Batch Normalized Inference Network Keeps the KL Vanishing Away","venue":"cs.LG","work_id":"3e7830a8-e472-4875-b30b-0f422485ee5e","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.521996Z"},"links":{"cited_paper":"/paper/2004.12585","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:41de88c8010f93c0a73a8b58d812eb36bc13009afb760f5fce20df36ae7c1e5b","observation_id":"75ac5187-8e31-46cb-a028-a4a91e253f5d","resolution":{"observed_at":"2026-08-07T05:20:56.681323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.884923Z","title":"Weight normalization: A simple repa- rameterization to accelerate training of deep neural networks,","venue":null,"work_id":"251b1baf-9494-4301-a74a-f715014194f0","year":2016},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.526933Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:8a4fedab57bcfbd25e1877ee5f215789ae530fcf8029719f263751a9c0aeb9e7","observation_id":"131ea2c9-9d5d-43a5-a1ef-22a52f3f1cb4","resolution":{"observed_at":"2026-08-07T05:20:56.889796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11929","last_updated":"2020-12-22T11:03:14Z","snapshot_observed_at":"2026-08-02T20:48:08.380579Z","submitted_at":"2020-12-22T11:03:14Z","title":"Full characterization of graphs having certain normalized Laplacian eigenvalue of multiplicity $n-3$","version":1},"cited_work":{"arxiv_id":"2012.11929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.11929","snapshot_observed_at":"2026-08-07T05:20:56.652153Z","title":"Full characterization of graphs having certain normalized Laplacian eigenvalue of multiplicity $n-3$","venue":"math.CO","work_id":"7e26da96-060e-4dc3-bdc9-f2e22b5e67a5","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.531854Z"},"links":{"cited_paper":"/paper/2012.11929","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:0ef49ae3861dd37dc6824949e3ea3365f4aa838e53160d0b796bce261b245d87","observation_id":"a85770cb-cfa8-45ba-9f37-9064db54ea4b","resolution":{"observed_at":"2026-08-07T05:20:56.659146Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T05:20:56.536930Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.536930Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:ec4b14cea6b0842e4ba3e3be52d3a89dcd568c39e3daccaf4306b883565aed66","observation_id":"b1404a95-a522-4169-adbf-291624ac1cc5","resolution":{"observed_at":"2026-08-07T05:20:56.536930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10132","last_updated":"2021-06-18T13:50:38Z","snapshot_observed_at":"2026-07-06T11:20:43.002537Z","submitted_at":"2021-06-18T13:50:38Z","title":"VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10132","snapshot_observed_at":"2026-08-07T05:20:56.542341Z","title":"Vqmivc: Vector quantization and mutual information-based unsuper- vised speech representation disentanglement for one-shot voice conver- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.542341Z"},"links":{"cited_paper":"/paper/2106.10132","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:e19618309ab0d0914d408c6f94bd5bf8ac7f7903265ca29b14315e725c223117","observation_id":"8ad16dc9-375f-4d02-b738-9802b2727d04","resolution":{"observed_at":"2026-08-07T05:20:56.542341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T05:20:56.547171Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.547171Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:1eb7d641a13d19f3a27ce93294db0fb6053e8ca9cb249e9e5ab1947f6b55bad6","observation_id":"134021ad-73cd-4059-9552-ca3d68a60a33","resolution":{"observed_at":"2026-08-07T05:20:56.547171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-07T05:20:56.553076Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.553076Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:3fdd8ae578537cc7a914410c7dde5109b7c3fd448ce758b09477d964324a88e9","observation_id":"5701ea33-46d4-41af-8625-d3a9f0423779","resolution":{"observed_at":"2026-08-07T05:20:56.553076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:22:40.573998Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.08348."}