{"as_of":"2026-08-11T10:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be81fdb800f990688df2d2a25d3b324915ffa1983a7855f108410e5d74295a88","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:09:29.274644Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:09:29.115029Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T14:09:29.631486Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"cited_work":{"arxiv_id":"2501.15613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15613","snapshot_observed_at":"2026-08-10T14:09:29.631486Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","venue":"cs.SD","work_id":"8c08be2e-1f2e-4091-a2cc-3504905ca56f","year":2025},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.115029Z"},"links":{"cited_paper":"/paper/2501.15613","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:304edb7d3c01f21c6a907cbba9b22a005ffad7b74131e30e92ff9be9a0ec47af","observation_id":"3437bcf1-a183-443f-abef-bf13824dee73","resolution":{"observed_at":"2026-08-10T14:09:29.636754Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15613/citation-record","integrity":"/paper/2501.15613/integrity","json":"/paper/2501.15613/citation-record.json","paper":"/paper/2501.15613"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.871221Z","title":"This technol- ogy is widely used in various fields, including speaker dis- guise, singing voice conversion, computer-assisted pronuncia- tion training, and voice cloning","venue":null,"work_id":"f799eb05-98f4-480c-a07d-eb037232607f","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.109290Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:d80e69737883a9d4e2c1b710d72386b78dfa7b11230d1a249f43efeaa314ec2c","observation_id":"b2328994-1833-4b0f-b24f-bd313fd988d2","resolution":{"observed_at":"2026-08-10T14:09:29.877986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"cited_work":{"arxiv_id":"2501.15613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15613","snapshot_observed_at":"2026-08-10T14:09:29.631486Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","venue":"cs.SD","work_id":"8c08be2e-1f2e-4091-a2cc-3504905ca56f","year":2025},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.115029Z"},"links":{"cited_paper":"/paper/2501.15613","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:304edb7d3c01f21c6a907cbba9b22a005ffad7b74131e30e92ff9be9a0ec47af","observation_id":"3437bcf1-a183-443f-abef-bf13824dee73","resolution":{"observed_at":"2026-08-10T14:09:29.636754Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.854624Z","title":"This dual objective enables the system to eliminate residual speaker traces as much as possi- ble while maintaining functionality","venue":null,"work_id":"633fa258-1353-4cb5-8162-5885800b8358","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.119741Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:7746f1353251f43a2153e6fb1a06debc3d1ab31197212f60aa8a3445d15f4949","observation_id":"7c1cf2f1-fe5d-4c19-b6cf-1890e7a0af88","resolution":{"observed_at":"2026-08-10T14:09:29.860561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.839391Z","title":null,"venue":null,"work_id":"8dfc972f-0f48-4afd-96bc-13140d8deca6","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.124052Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:ca318b45af34aff2bf1cedd996dfd91f66fb12ad0fac67abf8a2984c89468651","observation_id":"29fd9866-51f1-44d7-8645-422d1109d69f","resolution":{"observed_at":"2026-08-10T14:09:29.844106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.823520Z","title":"One loss function employs relaxed adversarial learning that separates the origi- nal fierce adversarial interaction","venue":null,"work_id":"781ce361-789e-4b40-b269-7dcc9601364c","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.129016Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:bc93f66a340d80034a2ce4fd01f25aee3d45e5f329d81882427ab5aabdb0450d","observation_id":"f565eeb2-1d81-49f9-967c-dc4b94db4764","resolution":{"observed_at":"2026-08-10T14:09:29.828655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.806701Z","title":"Preparatory Stage For simplicity, we denote the content encoder input (source speech), the speaker identity, and the converted speech with x, i, y ϵ X, I, Y , respectively","venue":null,"work_id":"81c1876a-a89f-424f-b763-ee9706abff33","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.133562Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:f9e63d48e183fa3da876a76da0017946d4e91e3aa4f13d45f6ef21a79c64cdea","observation_id":"b36eb125-28d1-43a5-b209-619941c5e5a3","resolution":{"observed_at":"2026-08-10T14:09:29.812984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.790780Z","title":null,"venue":null,"work_id":"12c99def-9d35-4f60-bf31-648567e34d19","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.139714Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:38de1acdb8a7238eb845974a57d87bb2ed60aa62221052381b8b7ccd7528c613","observation_id":"407f4633-a097-4bd5-af4b-0871e59cbf8c","resolution":{"observed_at":"2026-08-10T14:09:29.795651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.773830Z","title":null,"venue":null,"work_id":"b3b174e0-087b-4cdf-8316-aaa6cf777527","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.145496Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:45e26288c2cc60b2268c69bd2c12eb36dc092d497b0f56d6c2f1f85325683af0","observation_id":"7b0f8fa2-5795-4ce8-bb1c-7479e2661c5f","resolution":{"observed_at":"2026-08-10T14:09:29.778713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.756656Z","title":"C indicates convolu- tion layer","venue":null,"work_id":"fff85e65-db3d-499f-8d9d-3cda1c45b132","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.150844Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:9293f3f638f09c75a6ca78f92150de860e9e01b66dd4c071cdbfc24aeebd88fa","observation_id":"1ef09fd5-119d-4783-b904-07855145d972","resolution":{"observed_at":"2026-08-10T14:09:29.762685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.738822Z","title":null,"venue":null,"work_id":"11f52aac-7aed-40ed-a434-3e7a5445f482","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.155582Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:fb803b8136a50d5022659fdda30488364bcdfc2f0b71dde48bd35629662921be","observation_id":"351f1697-0622-4ac1-bdaa-7e9fde1c8df0","resolution":{"observed_at":"2026-08-10T14:09:29.745019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.721788Z","title":null,"venue":null,"work_id":"1e6d9a56-b377-4e28-bd38-b9c721e1b4e4","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.160299Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:0cfc79cb4fb15a840e558b4321911d248316bfb7236b5b44ddf903922f749e08","observation_id":"7928c2f6-d9b9-406d-a2a6-62d4fc0553e4","resolution":{"observed_at":"2026-08-10T14:09:29.727898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.03648","last_updated":"2020-11-17T04:42:31Z","snapshot_observed_at":"2026-08-11T07:38:50.173819Z","submitted_at":"2020-08-09T04:31:16Z","title":"An Overview of Voice Conversion and its Challenges: From Statistical Modeling to Deep Learning","version":2},"cited_work":{"arxiv_id":"2008.03648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.03648","snapshot_observed_at":"2026-08-10T14:09:29.608723Z","title":"An Overview of Voice Conversion and its Challenges: From Statistical Modeling to Deep Learning","venue":"eess.AS","work_id":"ae0cca16-901e-40eb-8b39-f834a7258673","year":2020},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.165462Z"},"links":{"cited_paper":"/paper/2008.03648","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:2f2205dff0e2629cc2ca1209f8a8062966d40195d5e1a640f98b2d8562baf2e0","observation_id":"60d359b8-67c4-41e9-9496-f8092b1fa6f7","resolution":{"observed_at":"2026-08-10T14:09:29.614065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.704647Z","title":"Unsupervised speech decomposition via triple information bottleneck,","venue":null,"work_id":"137dfeed-42fd-4e62-a3ba-cc06c3881275","year":2021},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.171809Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:e1b2ed1eddc14f63c3da12171eb0d252c79e0de30ae161634e4d4d3659fdfee7","observation_id":"2211ea8d-580f-4ea8-8ca3-0154368f05f3","resolution":{"observed_at":"2026-08-10T14:09:29.710519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.11293","last_updated":"2017-12-20T14:27:33Z","snapshot_observed_at":"2026-07-06T06:12:00.680441Z","submitted_at":"2017-11-30T09:57:19Z","title":"Parallel-Data-Free Voice Conversion Using Cycle-Consistent Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.11293","snapshot_observed_at":"2026-08-10T14:09:29.177465Z","title":"Parallel-data-free voice conversion using cycle-consistent adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.177465Z"},"links":{"cited_paper":"/paper/1711.11293","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:de4417eb4286d37ab66b6160d799fc11fa9052d6b2e45b318fe5568a4deb6162","observation_id":"6f4d2168-7048-4c1f-805d-64af007ef036","resolution":{"observed_at":"2026-08-10T14:09:29.177465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.04631","last_updated":"2019-04-09T12:55:35Z","snapshot_observed_at":"2026-07-06T07:44:56.677172Z","submitted_at":"2019-04-09T12:55:35Z","title":"CycleGAN-VC2: Improved CycleGAN-based Non-parallel Voice Conversion","version":1},"cited_work":{"arxiv_id":"1904.04631","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.04631","snapshot_observed_at":"2026-08-10T14:09:29.567852Z","title":"CycleGAN-VC2: Improved CycleGAN-based Non-parallel Voice Conversion","venue":"cs.SD","work_id":"004f6027-ea19-4d19-a684-68df3d4f6753","year":2019},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.183259Z"},"links":{"cited_paper":"/paper/1904.04631","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:53353322ef4d3019f724e137548a7542bef3eb377f506b0939744bce182d93f3","observation_id":"24284f2b-ff21-42e5-853b-ac06a209dc2b","resolution":{"observed_at":"2026-08-10T14:09:29.574767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.04019","last_updated":"2016-10-13T10:52:25Z","snapshot_observed_at":"2026-07-06T05:14:27.061204Z","submitted_at":"2016-10-13T10:52:25Z","title":"Voice Conversion from Non-parallel Corpora Using Variational Auto-encoder","version":1},"cited_work":{"arxiv_id":"1610.04019","doi":null,"metadata_source":"pith","pith_arxiv_id":"1610.04019","snapshot_observed_at":"2026-08-10T14:09:29.544763Z","title":"Voice Conversion from Non-parallel Corpora Using Variational Auto-encoder","venue":"stat.ML","work_id":"9fa02fcc-54a7-4ce5-92ce-ee8285e300cf","year":2016},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.188373Z"},"links":{"cited_paper":"/paper/1610.04019","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:35fe7bab8c0bd0f7d1ba01feea8a4148896e7814fd199364e5aac542262bc74a","observation_id":"3070fac6-42c7-46e9-b3b6-3f3db3fd6058","resolution":{"observed_at":"2026-08-10T14:09:29.550469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05742","last_updated":"2019-08-22T17:18:16Z","snapshot_observed_at":"2026-07-06T07:45:28.742612Z","submitted_at":"2019-04-10T16:22:18Z","title":"One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05742","snapshot_observed_at":"2026-08-10T14:09:29.193999Z","title":"One- shot voice conversion by separating speaker and content representations with instance normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.193999Z"},"links":{"cited_paper":"/paper/1904.05742","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:dadc43ca6cc19cb734e3a12a9dbacdbf053c654b36949931c03914e7a88a888f","observation_id":"5706297a-322a-4ac0-bd38-9a5ac09a2d9e","resolution":{"observed_at":"2026-08-10T14:09:29.193999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05879","last_updated":"2019-06-06T05:44:48Z","snapshot_observed_at":"2026-08-05T07:49:49.965149Z","submitted_at":"2019-05-14T23:19:04Z","title":"AUTOVC: Zero-Shot Voice Style Transfer with Only Autoencoder Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05879","snapshot_observed_at":"2026-08-10T14:09:29.199368Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.199368Z"},"links":{"cited_paper":"/paper/1905.05879","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:7059a41986137ef9fce9019c6aacac54678de050992028bcf31139ecd9bc8c39","observation_id":"82843b4e-d1a3-468b-ac09-bb2823a06a40","resolution":{"observed_at":"2026-08-10T14:09:29.199368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00794","last_updated":"2019-09-05T12:20:50Z","snapshot_observed_at":"2026-07-06T07:57:29.321260Z","submitted_at":"2019-06-03T13:33:36Z","title":"Blow: a single-scale hyperconditioned flow for non-parallel raw-audio voice conversion","version":2},"cited_work":{"arxiv_id":"1906.00794","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.00794","snapshot_observed_at":"2026-08-10T14:09:29.485132Z","title":"Blow: a single-scale hyperconditioned flow for non-parallel raw-audio voice conversion","venue":"cs.LG","work_id":"05537960-6841-4f04-830a-df00a0b408df","year":2019},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.204252Z"},"links":{"cited_paper":"/paper/1906.00794","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:eb8f8b0b4ae038b9fe40a540f151ae261b3cf2e7c3bf0235a0283c462911590c","observation_id":"f6453f2b-de72-42d1-b8f7-401324a19d90","resolution":{"observed_at":"2026-08-10T14:09:29.491320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-10T09:42:49.853165Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-10T14:09:29.209538Z","title":"Diffusion-based voice conversion with fast maximum likelihood sampling scheme,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.209538Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:2fb7a15701cf2e3266f202bca6974b6c3fdc5decfefd7b913bcea4dd24c63bf8","observation_id":"a7708550-21c0-46a7-999f-be4b9a4bb678","resolution":{"observed_at":"2026-08-10T14:09:29.209538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03078","last_updated":"2024-01-05T22:37:26Z","snapshot_observed_at":"2026-07-06T17:12:10.787061Z","submitted_at":"2024-01-05T22:37:26Z","title":"StreamVC: Real-Time Low-Latency Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03078","snapshot_observed_at":"2026-08-10T14:09:29.214811Z","title":"Streamvc: Real-time low-latency voice conversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.214811Z"},"links":{"cited_paper":"/paper/2401.03078","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:97c1618399f433134bd17554d5ab1b7f4adf854486d7d491878965d90b59733d","observation_id":"c48f9095-0406-442c-ab30-958bc95832a9","resolution":{"observed_at":"2026-08-10T14:09:29.214811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.220413Z","title":"An overview of multi-task learning in deep neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.220413Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:8d6f94437a42f91f5d0adb4c5d15ef105a68c799c09b7be65ce0630e1220d703","observation_id":"c71b673d-e562-4cad-8b3a-537f2b796281","resolution":{"observed_at":"2026-08-10T14:09:29.220413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.677213Z","title":"Multi-task learning using uncertainty to weigh losses for scene geometry and semantics,","venue":null,"work_id":"7d196aa6-a7aa-4921-8023-582b8cf5504e","year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.225009Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:c8e2e4a6be52b8d2fb497c29a350c15a90e2bbe4c7bea2403406408c492ae933","observation_id":"a289c6d1-157d-477d-860e-75c7c2dbb7fe","resolution":{"observed_at":"2026-08-10T14:09:29.682267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12389","last_updated":"2019-04-07T23:40:14Z","snapshot_observed_at":"2026-08-07T08:07:44.514691Z","submitted_at":"2019-03-29T08:26:13Z","title":"Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet","version":2},"cited_work":{"arxiv_id":"1903.12389","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.12389","snapshot_observed_at":"2026-08-10T14:09:29.408965Z","title":"Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet","venue":"eess.AS","work_id":"840e269c-e221-4fc9-a448-48f7851e96ae","year":2019},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.234414Z"},"links":{"cited_paper":"/paper/1903.12389","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:218529907c2e5facff615aa38d7f452ae76e49d342966ef131e83293f0645bd6","observation_id":"db5359d1-0ebe-4d58-9cb1-156278467b08","resolution":{"observed_at":"2026-08-10T14:09:29.415101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.02169","last_updated":"2018-06-29T06:19:34Z","snapshot_observed_at":"2026-08-10T11:59:13.527215Z","submitted_at":"2018-06-06T13:24:23Z","title":"StarGAN-VC: Non-parallel many-to-many voice conversion with star generative adversarial networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.02169","snapshot_observed_at":"2026-08-10T14:09:29.239659Z","title":"Stargan- vc: Non-parallel many-to-many voice conversion with star generative adversarial networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.239659Z"},"links":{"cited_paper":"/paper/1806.02169","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:f9d529bac5c96d32c1dca11fb51fa98e671fca19b6e59c1c198e3e8bc31cde3c","observation_id":"967756f9-c963-42fd-8882-1b1e3d757c77","resolution":{"observed_at":"2026-08-10T14:09:29.239659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02812","last_updated":"2018-06-24T18:11:02Z","snapshot_observed_at":"2026-07-06T06:32:22.055820Z","submitted_at":"2018-04-09T04:31:43Z","title":"Multi-target Voice Conversion without Parallel Data by Adversarially Learning Disentangled Audio Representations","version":2},"cited_work":{"arxiv_id":"1804.02812","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.02812","snapshot_observed_at":"2026-08-10T14:09:29.365807Z","title":"Multi-target Voice Conversion without Parallel Data by Adversarially Learning Disentangled Audio Representations","venue":"eess.AS","work_id":"e55c8ef7-90f5-4c70-978a-8005e91b46cb","year":2018},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.244523Z"},"links":{"cited_paper":"/paper/1804.02812","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:058b73860ed5127ac8709b57584f3fc05be598c0a1af4970654dd751bcbb94bc","observation_id":"5edbba2a-698a-4112-978a-ed7c83d3954c","resolution":{"observed_at":"2026-08-10T14:09:29.372925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.249449Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.249449Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:87af33cad2f45a1fc0324ba5385a730974c6f9f5e40ccc485e1e7b769b0a3330","observation_id":"04bb5322-8e84-43c6-8e4d-7ef434860db2","resolution":{"observed_at":"2026-08-10T14:09:29.249449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07004","last_updated":"2018-11-26T13:54:12Z","snapshot_observed_at":"2026-07-06T05:19:33.033655Z","submitted_at":"2016-11-21T20:48:16Z","title":"Image-to-Image Translation with Conditional Adversarial Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07004","snapshot_observed_at":"2026-08-10T14:09:29.254233Z","title":"Image-to- image translation with conditional adversarial networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.254233Z"},"links":{"cited_paper":"/paper/1611.07004","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:6522ba2e324ac5e6c9f5244bb483ea2276a0a07e0845087bde9834d2f947822d","observation_id":"01dee709-7d43-49b1-a145-79953f6722a5","resolution":{"observed_at":"2026-08-10T14:09:29.254233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00028","last_updated":"2017-12-25T23:03:49Z","snapshot_observed_at":"2026-08-10T12:15:09.941778Z","submitted_at":"2017-03-31T19:25:00Z","title":"Improved Training of Wasserstein GANs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00028","snapshot_observed_at":"2026-08-10T14:09:29.259872Z","title":"Improved training of wasserstein gans,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.259872Z"},"links":{"cited_paper":"/paper/1704.00028","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:d60e490a48bf4846566d21058db69ceb85817f20a0ee1341ed968e01369c0846","observation_id":"f0aaab18-73bd-4b38-bf5c-4a5461e21c1e","resolution":{"observed_at":"2026-08-10T14:09:29.259872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.264913Z","title":"Evaluating openai’s whisper asr: Performance analysis across diverse accents and speaker traits,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.264913Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:60024cd2160ef513a6d68aa0be510cebb9fdad26ea473707534f7e096d0cc3b4","observation_id":"3a4889c1-cb05-46d0-839b-4b0f3f30e406","resolution":{"observed_at":"2026-08-10T14:09:29.264913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.660012Z","title":"Articulation rate as a metric in spoken language assessment,","venue":null,"work_id":"927b637f-d3d6-4f80-9c21-92b227f005a4","year":2019},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.270031Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:ec19b2dec66e402d4fa28228396f6df99077d619a4603639a7257ca81f9e8627","observation_id":"56a9dc6f-7ece-48c5-bf63-3cb15e94f8f5","resolution":{"observed_at":"2026-08-10T14:09:29.665826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:09:29.274644Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.274644Z"},"links":{"citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:a2023c0e22f9a5b4a788cb88f963b25582c1d4ccd70ff297ee7965c9acbfcc0a","observation_id":"c54837d8-78c8-4803-8482-8ba5e83dc6d5","resolution":{"observed_at":"2026-08-10T14:09:29.274644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07115","last_updated":"2018-04-24T06:42:35Z","snapshot_observed_at":"2026-07-06T05:43:25.911696Z","submitted_at":"2017-05-19T17:56:57Z","title":"Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07115","snapshot_observed_at":"2026-08-10T14:09:29.229792Z","title":"Available: https://arxiv.org/abs/1705.07115","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:29.229792Z"},"links":{"cited_paper":"/paper/1705.07115","citing_paper":"/paper/2501.15613"},"observation_digest":"sha256:981066c1a986ca629e096bb56611da4c63eab94bcdf2c69a01e2a4b7c40c7dbc","observation_id":"d365c266-11d0-4e2f-96ee-0902591a2ba5","resolution":{"observed_at":"2026-08-10T14:09:29.229792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15613","last_updated":"2025-01-26T17:43:32Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T21:57:36.848610Z","submitted_at":"2025-01-26T17:43:32Z","title":"Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":6,"verified_fuzzy":8},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2501.15613."}