{"as_of":"2026-08-08T14:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9422ecbafe6de20767f8a3e37a9bb9564c9d638ade9b0104729b72d20882a4f4","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:46:57.947567Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:45:37.826763Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01510","snapshot_observed_at":"2026-08-07T11:45:37.826763Z","title":"During train- ing (top), a linear transformation from a source to a target speaker is learned","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.826763Z"},"links":{"cited_paper":"/paper/2506.01510","citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:2e13228dade52a1edfdc191f8c7a108554891c361cc51106e077af541a9798c5","observation_id":"0d78a906-bd8a-4827-9f57-05b1ae672821","resolution":{"observed_at":"2026-08-07T11:45:37.826763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"cited_work":{"arxiv_id":"2506.01510","doi":"10.48550/arxiv.2506.01510","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01510","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.48550/arXiv.2506.01510 , abstract =","venue":"ArXiv.org","work_id":"67695907-56ae-4365-bcd3-dd2a322145e0","year":null},"citing_paper":{"arxiv_id":"2605.01381","last_updated":"2026-05-02T11:08:10Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T11:08:10Z","title":"A framework for analyzing concept representations in neural models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-09T14:49:22.776209Z"},"links":{"cited_paper":"/paper/2506.01510","citing_paper":"/paper/2605.01381"},"observation_digest":"sha256:cbee64af9c7a432d188977148ff6e4064379d8d21db03962a827ca78811b2510","observation_id":"a8230ccd-c49a-43f6-ac8f-d862948c0055","resolution":{"observed_at":"2026-05-09T22:18:59.365600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01510/citation-record","integrity":"/paper/2506.01510/integrity","json":"/paper/2506.01510/citation-record.json","paper":"/paper/2506.01510"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.774823Z","title":"It has applications in entertainment [3], language tutoring [4], accessible speech processing [5–7], and anonymization [8]","venue":null,"work_id":"3f50c96e-8a04-4c5d-bb8d-4902bbe03dd3","year":null},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.789468Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:7946574c6c663eccb5a5a5c1ec33f53b00cb443aca1402f872033a9f689e9a33","observation_id":"ab14a077-98d7-460c-808d-8fbf32ab5a2b","resolution":{"observed_at":"2026-08-07T11:46:59.815870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01510","snapshot_observed_at":"2026-08-07T11:45:37.826763Z","title":"During train- ing (top), a linear transformation from a source to a target speaker is learned","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.826763Z"},"links":{"cited_paper":"/paper/2506.01510","citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:2e13228dade52a1edfdc191f8c7a108554891c361cc51106e077af541a9798c5","observation_id":"0d78a906-bd8a-4827-9f57-05b1ae672821","resolution":{"observed_at":"2026-08-07T11:45:37.826763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.688686Z","title":null,"venue":null,"work_id":"5b664fe2-cf32-49be-9891-fcbceb0afdc1","year":null},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.870747Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:f8349ab5aecf83bdd53a3139e59aa5e3eb6f082a4f13ef9fd185cee732f37ec5","observation_id":"a9a9dbca-a4ff-406d-8938-e6cd13939d44","resolution":{"observed_at":"2026-08-07T11:46:59.717754Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.607227Z","title":"Figure 2 gives a cartoon illustration of the different configura- tions","venue":null,"work_id":"dfd52f98-3742-41c7-aa83-bab0bd33d5fa","year":null},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.900481Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:c97bec47863806e31c4af744216a8c71845c1e5ac7e3d7276530e699c24a1e97","observation_id":"41430ee3-1242-4a45-b344-6fc54e3e4f58","resolution":{"observed_at":"2026-08-07T11:46:59.648727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.526721Z","title":"In this section, we validate this interpretation by explicitly disentangling content and speaker information","venue":null,"work_id":"26796bba-010e-46dd-82f6-a5905098f11f","year":null},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.921027Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:23cdb6b5f75da5a52b7f8b2c261ea866ef8a79a43fd23ba79c6bececa929ea80","observation_id":"79452e4f-ea10-401e-b8f5-62a336bef74c","resolution":{"observed_at":"2026-08-07T11:46:59.557600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.455627Z","title":"In addition to providing a practical solution to voice conversion without requiring complex model training, it offers valuable insights into the organization of SSL features","venue":null,"work_id":"358c911b-327c-4269-8488-e7035ebca26b","year":null},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.943068Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:47547d3914bcd21cf9256b7a0a9b1a7c999ac94c22710631706314b389b5269b","observation_id":"1b8869dc-cee8-40dc-87d4-8c9bea00a9ce","resolution":{"observed_at":"2026-08-07T11:46:59.487202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.384905Z","title":"An overview of voice conversion systems,","venue":null,"work_id":"b72473e9-fbda-4bc8-b52f-5803350c5f41","year":2017},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.960076Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:e72fd3a26015375221ad2850129acd9f4e89b10ce8af702b5976cb5ea05cdde3","observation_id":"fd475f4d-af9e-4dbe-887c-e26a63c5f211","resolution":{"observed_at":"2026-08-07T11:46:59.416867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.297757Z","title":"An overview of voice conversion and its challenges: From statistical modeling to deep learning,","venue":null,"work_id":"688286a1-310f-4918-b9ca-aeb41b8b805f","year":2020},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.981395Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:25d92b241dd81532c93d219e5604f583a1139404728f92822b130e95c3f62aae","observation_id":"465f55be-e3f9-4700-902d-2574a4d54b28","resolution":{"observed_at":"2026-08-07T11:46:59.337571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.226753Z","title":"Making of Season 2 finale,","venue":null,"work_id":"915a49e6-a4a2-4de8-bfbf-8d9d738b734b","year":2021},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.998513Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:78afb8761be8bebe8207fa11dc8087e4d8647180e46552ca01caf4fe9c80a411","observation_id":"95a55dbc-2c45-4d41-a10d-9f255718703f","resolution":{"observed_at":"2026-08-07T11:46:59.260236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.149093Z","title":"A pilot study of applying sequence-to-sequence voice conversion to evaluate the intelligibil- ity of L2 speech using a native speaker’s shadowings,","venue":null,"work_id":"a82d5afc-59b6-4401-a885-a29dbccf2277","year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.015691Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:7577da55c004a2a237f4ce71922ac122b530760a3e805cb69fd01b7df7ff9c6d","observation_id":"c3be20bb-716b-4bf7-97ef-01e662b4c70d","resolution":{"observed_at":"2026-08-07T11:46:59.179684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.072564Z","title":"Respeecher gives voice to Michael York in healthcare initiative,","venue":null,"work_id":"e927496e-0723-47a8-a79e-abb1295cc9ad","year":2021},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.035801Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:a7b52165014e65d235b570597ddf8a79fec40ef44763db7016d0fd41dc06a819","observation_id":"ae4b8c16-763b-4a1d-b076-1f7129abc91a","resolution":{"observed_at":"2026-08-07T11:46:59.112352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.023143Z","title":"V oice conversion for stuttered speech, instruments, unseen languages and textually described voices,","venue":null,"work_id":"339ca3f6-0023-44ac-af61-b9f9e0b5e4ad","year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.053963Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:101fed76013f6654ff8d0c56211f42681e31e5a67b08addbaf478fb7726f36c3","observation_id":"78c019c6-cab8-46fa-8320-563285b5c060","resolution":{"observed_at":"2026-08-07T11:46:59.033065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.955425Z","title":"Unsupervised rhythm and voice conversion of dysarthric to healthy speech for ASR,","venue":null,"work_id":"9eb64cce-ddf7-49b2-9d82-6dd733e5cbe6","year":2025},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.071696Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:358527c4c7414900f73968317d9214a688ac60188c2660838cc73aacce56fe0c","observation_id":"aa5b528d-0472-4a28-849e-1c67f39eff77","resolution":{"observed_at":"2026-08-07T11:46:58.986847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.876330Z","title":"The V oicePrivacy 2022 Challenge: Progress and perspectives in voice anonymisation,","venue":null,"work_id":"bf76c706-8246-4818-bb75-7c63331a5ef3","year":2022},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.085112Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:86d885d0b248352505e712ae44f022dab81e503e5358b3a7f9cc05f131bb587d","observation_id":"ca219d27-0e25-4688-a1ed-cc2c2510d1af","resolution":{"observed_at":"2026-08-07T11:46:58.917252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T11:45:38.102076Z","title":"V ALL-E R: Robust and efficient zero- shot text-to-speech synthesis via monotonic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.102076Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:73e9402c4f87ccaa46e51e1fa4542b83d21e87a3fec02fad78a841ca63750d03","observation_id":"68b88b73-7536-4456-8910-c2cd7652884b","resolution":{"observed_at":"2026-08-07T11:45:38.102076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-07T11:45:38.121513Z","title":"SoundStorm: Efficient parallel audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.121513Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:300f65fa3ff9a23a62f87f8d3a5b1f84cb9c4aebec2e0cf73b9a5a3e3d22976f","observation_id":"c228fe17-7bb9-4b6b-8f96-191053bcc245","resolution":{"observed_at":"2026-08-07T11:45:38.121513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08296","last_updated":"2023-02-23T05:43:07Z","snapshot_observed_at":"2026-08-06T20:00:24.837125Z","submitted_at":"2023-02-16T13:49:09Z","title":"QuickVC: Any-to-many Voice Conversion Using Inverse Short-time Fourier Transform for Faster Conversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08296","snapshot_observed_at":"2026-08-07T11:45:38.135765Z","title":"QuickVC: Any-to- many voice conversion using inverse short-time fourier transform for faster conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.135765Z"},"links":{"cited_paper":"/paper/2302.08296","citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:59bf1e020e98ae7c545fa9c87a48d75c920ade960dc4ddbe9add7a126aa1d3d9","observation_id":"bfc86b80-f339-42a5-9e67-dd2bdd96572b","resolution":{"observed_at":"2026-08-07T11:45:38.135765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.772327Z","title":"StreamVC: Real-time low-latency voice conversion,","venue":null,"work_id":"0c048d47-44f9-467c-b588-030ea7ea8e10","year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.149798Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:2d8a36f216912161b3dd93867a462e1c5651b6d10e1eae2f0e079dc928512e70","observation_id":"e86d307a-e1cb-46dd-8987-23ae4994067a","resolution":{"observed_at":"2026-08-07T11:46:58.829409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.691458Z","title":"Frag- mentVC: Any-to-any voice conversion by end-to-end extracting and fusing fine-grained voice fragments with attention,","venue":null,"work_id":"a59e3f77-8ff6-4b75-82ab-1f232fa8ee85","year":2021},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.169507Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:4776f71684ffc7facf22801d669dbd169f13ea19c0b356f4a5258a1789024be0","observation_id":"ff463cbd-94a6-4078-84a5-fc4c678efb8b","resolution":{"observed_at":"2026-08-07T11:46:58.730869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.657450Z","title":"V oice conversion with just nearest neighbors,","venue":null,"work_id":"50748a35-50c8-4f77-a80d-e86ad130e324","year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.186258Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:5f8ffec06305b5dc00edacb600c7dec675903b21ac1bb2bcaccd695c4db021b3","observation_id":"85444603-b158-4f02-8c8f-e73be7b85069","resolution":{"observed_at":"2026-08-07T11:46:58.668576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02402","last_updated":"2024-10-17T22:48:53Z","snapshot_observed_at":"2026-08-07T17:12:48.861597Z","submitted_at":"2024-10-17T22:48:53Z","title":"Optimal Transport Maps are Good Voice Converters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02402","snapshot_observed_at":"2026-08-07T11:45:38.202201Z","title":"Optimal transport maps are good voice converters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.202201Z"},"links":{"cited_paper":"/paper/2411.02402","citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:e9e19c5dcb54b76d105dfc6004397f948e8b7f9237595fe101ae8e75bd90faa8","observation_id":"20dbc463-5176-4d36-8bbd-753b4d09b0cd","resolution":{"observed_at":"2026-08-07T11:45:38.202201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.631904Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"7ebc03ac-60b0-47dc-946f-61d03ff8cca5","year":2022},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.217347Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:d1084a5a7df6568ffa787b4181f1373e4d7a6e926e2217cd231a654ccc1bdff4","observation_id":"2431bbb5-5fd6-4d2e-8022-d6447e359115","resolution":{"observed_at":"2026-08-07T11:46:58.644812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.610398Z","title":"Self-supervised predic- tive coding models encode speaker and phonetic information in orthogonal subspaces,","venue":null,"work_id":"46400d3f-4d96-4b0e-8ef9-4a0f4a5c0b4f","year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.233609Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:6c2a5a4e053325e34bf2515b0166aba92b0a72699443a0afea817bde7157f73f","observation_id":"2bc9aece-a7cf-465f-8252-883ee7bf6ebf","resolution":{"observed_at":"2026-08-07T11:46:58.618940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.585537Z","title":"Orthogo- nality and isotropy of speaker and phonetic information in self- supervised speech representations,","venue":null,"work_id":"df8df08b-b6ea-4526-aed9-0b54fd7c5dc7","year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.248093Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:4a45683e493778843b7f5336f91963351aed3a8453240666c962d9fac5594a5d","observation_id":"d254b58e-158a-455f-beb5-56832e4476b0","resolution":{"observed_at":"2026-08-07T11:46:58.595750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.559892Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":"7513d5be-6000-4687-8634-4212f235e627","year":2021},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.265957Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:b213f2775518495029dec1ef72caeca70ef63ad4e6bebe8cff023d1099583185","observation_id":"8c5b6d5a-a354-41e5-a99a-854ee013c150","resolution":{"observed_at":"2026-08-07T11:46:58.572099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.524374Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":"d13867ea-4071-4dad-b21c-5d4c4f0253cc","year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.282034Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:911b05e11107eb23b1149cf42d1c239ddfb010f27ebfc24b8bb964702c3cad5a","observation_id":"3bef0d60-43a0-46e7-a5b4-6f8edbcd3266","resolution":{"observed_at":"2026-08-07T11:46:58.535690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.485122Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"48e12e14-2ae8-49da-b9a0-dd591ee54a4a","year":2022},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.302427Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:990ec1d2fb0c34ca2742ff4e3564b0b17dfca4ef5a9a9eee8c94377c66e64248","observation_id":"ea742fdf-9aee-4293-b25d-513247252de1","resolution":{"observed_at":"2026-08-07T11:46:58.503878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.464873Z","title":"Phoneme hallucinator: One-shot voice conversion via set expansion,","venue":null,"work_id":"b1dfd31c-93cc-4ad7-bbc6-45ed895001c7","year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.324589Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:1b9311ec2f20c49a035a4a1f6d14f727af07096aac557662b1d4a687a1d119e7","observation_id":"187f796e-0417-470e-87f8-a5ae63cb78bd","resolution":{"observed_at":"2026-08-07T11:46:58.474721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:45:38.341471Z","title":"HiFi-GAN: Generative adversar- ial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.341471Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:b724c856d19088e41bac520e7db1ac56ee96ec8b9c4884de14c2f2379680e391","observation_id":"c63773ba-8140-40df-aee1-4ea90eb1783a","resolution":{"observed_at":"2026-08-07T11:45:38.341471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.437592Z","title":"Self-supervised models of speech infer universal articulatory kine- matics,","venue":null,"work_id":"a11bb5d5-b5e2-4045-a55c-e9fd2a8a6f01","year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.360428Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:2219e5c165729909ee2b5178ee59594d0f3d72e46b911c1ee3575fc77fdf93f4","observation_id":"97a7cdfb-d9fd-4ee8-af08-744a27f5a7df","resolution":{"observed_at":"2026-08-07T11:46:58.445131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:45:38.382137Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.382137Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:78f301bdea42236d0d2acc9bcc303dfb7f7e9dd6bc6625d489da78b7306a0d7a","observation_id":"e730d56e-c99a-46cb-9a6e-dbcedd7787e7","resolution":{"observed_at":"2026-08-07T11:45:38.382137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.401376Z","title":"Comparative layer-wise analysis of self-supervised speech models,","venue":null,"work_id":"a538cde9-55b7-475e-b013-387bd922e049","year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.394671Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:059d085728f7e4130bdbbf19cb0ba067adca9b6ba3e2f4b582d0f174de0a8512","observation_id":"ffbab32d-1a7a-48bc-b9fd-0fbf9cecd9e9","resolution":{"observed_at":"2026-08-07T11:46:58.414044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-07T11:45:38.415230Z","title":"DASB – Discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.415230Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:2251917816159c744a38fb5a69e9c444530502c9170a5871839c8fdd6cae77a3","observation_id":"b8cbdd30-4958-464e-9051-f5e170c0ea74","resolution":{"observed_at":"2026-08-07T11:45:38.415230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.379135Z","title":"FreeVC: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":"35fad93d-ac78-4693-ac14-ef8a4667d922","year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.433314Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:795dda31ec51d6011df61cb9a376dfee1feab037e9c971c62bd54e8a075f6bc5","observation_id":"b4c7bc64-ea88-44e6-8100-deb25cbf37a5","resolution":{"observed_at":"2026-08-07T11:46:58.390344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.357828Z","title":"Libri-Light: A benchmark for ASR with limited or no supervision,","venue":null,"work_id":"0eb68973-858b-4316-81dc-b7950cab431b","year":2020},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.448564Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:7d6f9e67857f7bab4710dc49c5f8152e3b4e28d5c3bd22469cb81814c436c322","observation_id":"6cdcd80e-4184-43bb-8574-9fa48c79cc4c","resolution":{"observed_at":"2026-08-07T11:46:58.368016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.334145Z","title":"V oice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conver- sion,","venue":null,"work_id":"47112284-2c38-4d0a-833c-d797b766a006","year":2020},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.468441Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:d34b89d7d8dc864defcf5fd0ceae214b9e2b0180fa1ea91c3e3a7f940a0adb6c","observation_id":"05a8d46d-2ea0-469d-90dd-c1237fb88363","resolution":{"observed_at":"2026-08-07T11:46:58.343857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:45:38.487873Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.487873Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:0a1fd7e7fa5aecc6e049dae013950b96aa8e5ae3a6d49c244fc8896b7903afbe","observation_id":"25ef7e2e-54a7-46c3-b1f6-bb2d0f41830c","resolution":{"observed_at":"2026-08-07T11:45:38.487873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.296117Z","title":"Predictions of subjective ratings and spoofing assessments of Voice Conversion Challenge 2020 submissions,","venue":null,"work_id":"1cf5a87c-276d-4efc-91f0-41ef5e166dad","year":2020},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.506325Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:8cf47df5b33f578035f10f6b3dc496018fcf77bb3312ce92536b484d30fdad8a","observation_id":"c543f0e5-1a5a-4d96-aba5-86a898d0e75e","resolution":{"observed_at":"2026-08-07T11:46:58.312568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.272180Z","title":"X-vectors: Robust DNN embeddings for speaker recognition,","venue":null,"work_id":"0f90c8d5-babd-4942-9181-2fe26be1e659","year":2018},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.521420Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:b96042ace73c6b02687df3be350ad1c9f313997837d82088c4bd02fbb4953f4b","observation_id":"2393d11f-0357-4127-b3f1-521e9490aa9f","resolution":{"observed_at":"2026-08-07T11:46:58.281577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.237107Z","title":"Method for the subjec- tive assessment of intermediate quality level of audio systems,","venue":null,"work_id":"7bf0ed2e-2418-4034-beac-6d1d57e099f8","year":2015},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:38.537066Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:56bbc06ae6bba39d28b263b27a52527bbd2bc822e73ebc57f4bd356e2f6fbb3c","observation_id":"10a2dabe-d05f-4aeb-8c14-026bdc7768fb","resolution":{"observed_at":"2026-08-07T11:46:58.253402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.205774Z","title":"Statistical tests with MUSHRA data,","venue":null,"work_id":"f6a384bc-d1b1-434f-9b21-1f652532ebef","year":2018},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:20.007919Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:dbb523d952fb51b6db4035fd2dd8ced2dab5d7832f53712a33edbb2440e01c1e","observation_id":"c1399f8e-56b8-4e50-b58f-d0602c85b7c9","resolution":{"observed_at":"2026-08-07T11:46:58.218868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.179730Z","title":"The use of ranks to avoid the assumption of normal- ity implicit in the analysis of variance,","venue":null,"work_id":"b3e20bf2-f84f-4ad8-bfbc-808228cc1c05","year":1937},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:56.237373Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:492cd0a0bcd97e8b23b8e553ee82bb52a097f771cfbedac570174c75d67ac36e","observation_id":"e20bf94e-b9fc-44c1-9ebd-d94519727f88","resolution":{"observed_at":"2026-08-07T11:46:58.189921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.160150Z","title":"Individual comparisons by ranking methods,","venue":null,"work_id":"ae5abba6-dbad-4e32-b906-c27b1833b4de","year":1945},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.915146Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:f1c262d0da30bb42069010f85f77bf7ea8364a7c0b2e3f5a80dc08ee61f79a1b","observation_id":"590fe4d6-4020-44ee-937a-aebab5859feb","resolution":{"observed_at":"2026-08-07T11:46:58.168171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.134715Z","title":"A generalized solution of the orthogonal Pro- crustes problem,","venue":null,"work_id":"6a022823-4ddf-4537-8e33-2a4fa0e535d7","year":1966},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.935189Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:0350f0e85a5ee53ea214056222baba4e7c192c61258f181957bfaca5fab1b629","observation_id":"ea87ef7e-652b-4c92-a7c9-eb608be321ff","resolution":{"observed_at":"2026-08-07T11:46:58.146471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.059766Z","title":"Eta- WavLM: Efficient speaker identity removal in self-supervised speech representations using a simple linear equation,","venue":null,"work_id":"5e262fbf-3a9c-4c3e-aeff-5101cfb1f8da","year":2025},"citing_paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.947567Z"},"links":{"citing_paper":"/paper/2506.01510"},"observation_digest":"sha256:2b34581234de3c592e61a249123024803dc0e2dcc6964224d3e6da00b9df55df","observation_id":"19effed2-1e8e-4daf-b7b8-9dced5afd5d7","resolution":{"observed_at":"2026-08-07T11:46:58.117068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01510","last_updated":"2025-06-02T10:18:02Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:37:13.502100Z","submitted_at":"2025-06-02T10:18:02Z","title":"LinearVC: Linear transformations of self-supervised features through the lens of voice conversion"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2506.01510."}