{"as_of":"2026-08-17T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d55930e0fa90c81bcd5a8fcd7443f6cc831d26ef855d59fe17136c06a9d1eef","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:22:44.288042Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:22:44.084075Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T18:22:44.403714Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"cited_work":{"arxiv_id":"2507.17735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.17735","snapshot_observed_at":"2026-08-15T18:22:44.403714Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","venue":"eess.AS","work_id":"53087d44-f7e6-45cd-9c54-a2c2977e6f6d","year":2025},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.084075Z"},"links":{"cited_paper":"/paper/2507.17735","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:9e9c501a20a887b690e8a1b23d96adf400296b7de4c235d504176473dd8cbaf2","observation_id":"56cec82a-4cef-4558-858a-aa341fa715e3","resolution":{"observed_at":"2026-08-15T18:22:44.408368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17735/citation-record","integrity":"/paper/2507.17735/integrity","json":"/paper/2507.17735/citation-record.json","paper":"/paper/2507.17735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.989134Z","title":"We study the way to convert the non-native (L2) accented speech into a native (L1) accented one","venue":null,"work_id":"33503528-26c1-4eca-8c04-4fa2a12cbd79","year":null},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.078184Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:3f7a585735096d55fd7fad91c6846691e1323655ec6d9b9069bae999050013dd","observation_id":"c3975430-fbed-4576-83e4-01ee1a97a853","resolution":{"observed_at":"2026-08-15T18:22:44.993831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"cited_work":{"arxiv_id":"2507.17735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.17735","snapshot_observed_at":"2026-08-15T18:22:44.403714Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","venue":"eess.AS","work_id":"53087d44-f7e6-45cd-9c54-a2c2977e6f6d","year":2025},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.084075Z"},"links":{"cited_paper":"/paper/2507.17735","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:9e9c501a20a887b690e8a1b23d96adf400296b7de4c235d504176473dd8cbaf2","observation_id":"56cec82a-4cef-4558-858a-aa341fa715e3","resolution":{"observed_at":"2026-08-15T18:22:44.408368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.976779Z","title":"ours w/ dur. scaling","venue":null,"work_id":"6a1af42f-7120-4d24-81b5-49f5ff5a2768","year":null},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.089066Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:629513f7c2ac55e1d96f91b3d97380925b15ecc03eb2304d45c784dd429cfc27","observation_id":"61f8d0ff-321b-425a-b5a6-a8cd11151c82","resolution":{"observed_at":"2026-08-15T18:22:44.981049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.964775Z","title":null,"venue":null,"work_id":"283fb0ba-a2dd-431d-a82c-22f5e11a2d0c","year":null},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.093800Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:0e5a9cc57f95abd2077aa765c10db34092c8f2269dcf4e3561c73854a8489815","observation_id":"778def70-d107-44d7-8230-baa755612bd5","resolution":{"observed_at":"2026-08-15T18:22:44.968855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.940026Z","title":"ours w/ dur. scal- ing","venue":null,"work_id":"7046fe55-2881-49ce-b9a5-c3f4f5cb4095","year":null},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.101541Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:8058df04f020787c9377711b3ac96f6883d93b7c8ef42a0a5051090297ec11ee","observation_id":"3a35856f-b650-4395-9c0f-15bcb6de2ab6","resolution":{"observed_at":"2026-08-15T18:22:44.943990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.928167Z","title":"Sub- jective evaluations on multiple English accents show signifi- cant improvements in speech naturalness, speaker similarity, and accentedness reduction","venue":null,"work_id":"2c92e8e4-6bce-4397-a170-40beefd39eab","year":null},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.106378Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:5d2673a99bcd95c9543a83fb046fa8b59b1aa170f53a04ccbf00f8d863e3c2af","observation_id":"4ff670ea-3c23-4794-a7eb-73c1f7daf46f","resolution":{"observed_at":"2026-08-15T18:22:44.932448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.916624Z","title":"62401377), Shenzhen Science and Technology Program (Shenzhen Key Laboratory, Grant No","venue":null,"work_id":"cca37702-b1cd-45fa-ab9d-71649cd4c9db","year":null},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.110029Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:33cfac9da75cebbb2e27e747489d9a11711f8cdf1a6e11668176d48edae2e48c","observation_id":"eed5d2f8-abeb-443c-99aa-112b3e1d02e8","resolution":{"observed_at":"2026-08-15T18:22:44.920651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.823878Z","title":"Vevo: Controllable zero-shot voice imitation with self-supervised disentanglement,","venue":null,"work_id":"bec9e294-d0c1-44b0-92c2-fa6879fc409c","year":2025},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.143428Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:7318274ec825c0b0a830ff36cbbd7eb4a94841d16ef5c2dce399aa0c8345cba1","observation_id":"276bb0fd-9576-4894-bf77-bb53e2aa1455","resolution":{"observed_at":"2026-08-15T18:22:44.827856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.904382Z","title":"Foreign accent conversion in computer assisted pronunciation training,","venue":null,"work_id":"82725790-6175-4d93-86aa-61762e844fa9","year":2009},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.113723Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:16c00d0de534402103d254bd7cc92e8f0cd09cc68e89e944d68107a285e58ba1","observation_id":"32dd395b-2f87-46c1-8d9b-06f443fbcdd2","resolution":{"observed_at":"2026-08-15T18:22:44.908223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.890648Z","title":"Subband based voice conversion","venue":null,"work_id":"83aa1aae-c259-4173-8e5e-b0062c71ed80","year":2002},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.117092Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:b7f36e23cef51ce38bb0bd8ee315b0b66664f649c9065936de3eb2348200889c","observation_id":"ddab51d9-aea5-4de6-acf0-616052ac06d9","resolution":{"observed_at":"2026-08-15T18:22:44.895245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.876348Z","title":"Personalized, cross-lingual tts using phonetic posteriorgrams","venue":null,"work_id":"73c7b205-4273-43d1-963d-fbf996709c29","year":2016},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.121959Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:482fbe8e0a0d371bebc611e6d4034f95fb36590191d552d4e7329f1259c95f51","observation_id":"9e685838-fd25-4e6f-a716-4093d3c013e1","resolution":{"observed_at":"2026-08-15T18:22:44.881327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.862832Z","title":"Accent conversion using phonetic posteriorgrams,","venue":null,"work_id":"68ec14aa-44e0-48f5-a300-b0c28978fcc0","year":2018},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.126050Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:93734f5ff0496827d50f3cd8fe3133158d5ade5afdfc8f9591fadadfcbb75f1f","observation_id":"fc20b8c8-8a3d-47cd-9add-d79cbb06b44b","resolution":{"observed_at":"2026-08-15T18:22:44.868318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.849295Z","title":"Foreign accent con- version by synthesizing speech from phonetic posteriorgrams","venue":null,"work_id":"9618b449-3556-4933-ba8e-7c7804857efd","year":2019},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.129970Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:b7278a77d742f8028c1f2714429f8158a585603c7c6b354a1121d2b795499bc7","observation_id":"ff37704f-983d-40b0-91e8-44ea64c958c1","resolution":{"observed_at":"2026-08-15T18:22:44.854211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09271","last_updated":"2020-05-19T08:09:58Z","snapshot_observed_at":"2026-08-15T10:04:41.630707Z","submitted_at":"2020-05-19T08:09:58Z","title":"Improving Accent Conversion with Reference Encoder and End-To-End Text-To-Speech","version":1},"cited_work":{"arxiv_id":"2005.09271","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.09271","snapshot_observed_at":"2026-08-15T18:22:44.381282Z","title":"Improving Accent Conversion with Reference Encoder and End-To-End Text-To-Speech","venue":"cs.CL","work_id":"6c16b355-ef06-4d3a-8db8-a31e196127e7","year":2020},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.134317Z"},"links":{"cited_paper":"/paper/2005.09271","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:f4001cac2fd5a50aa14ecca4a10208da71fbb63411deb62a2da1698de10b7263","observation_id":"2e8ba706-5070-4157-8be8-d45adc0b54df","resolution":{"observed_at":"2026-08-15T18:22:44.388217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.836388Z","title":"Accentron: Foreign accent conversion to arbitrary non-native speakers using zero-shot learning,","venue":null,"work_id":"8a381b8e-19c4-44f4-a8c2-eee99be9b97c","year":2022},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.138337Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:360acb555227b225600564d0c2f2f78e54c943fbd1ff735ba35e27824eb13b89","observation_id":"43a07d9b-f74a-45a1-8efd-79845d7c6596","resolution":{"observed_at":"2026-08-15T18:22:44.840973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.717560Z","title":"Tts-guided train- ing for accent conversion without parallel data,","venue":null,"work_id":"47072835-cf8c-4df6-a62f-7c7e04ccebca","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.176442Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:8c8df1f457859e25b3354bf9309a8da3f47f27804a0fb72693bfcd041726eab7","observation_id":"2be67f76-dc96-4d6f-b691-c3a75d9fb357","resolution":{"observed_at":"2026-08-15T18:22:44.722066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.812761Z","title":"Converting foreign accent speech without a reference,","venue":null,"work_id":"bb85a6ec-3ee9-4726-9fd9-87af81be1870","year":2021},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.147320Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:76040de893dbd14765da62f16f0702dcfdeb654b7e29710e2aff120c31241bfd","observation_id":"1eff0d85-25f6-4cc0-a252-e7e094b3eba7","resolution":{"observed_at":"2026-08-15T18:22:44.816213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.801654Z","title":"Accent conversion using pre-trained model and synthesized data from voice conver- sion","venue":null,"work_id":"e7a51d3a-2538-4dc8-a682-9c50afbc875c","year":2022},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.151718Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:3c18145a91f81f5e4a2b124b29b54d562826421f692275602e42d78fbf873a54","observation_id":"ac67fef1-390c-4396-9a84-3559d5d27d90","resolution":{"observed_at":"2026-08-15T18:22:44.804947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.790996Z","title":"Zero-shot foreign accent conversion without a native reference,","venue":null,"work_id":"93fb771f-c80d-4984-86be-5f39f96d66b3","year":2022},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.155872Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:36da30ec4c13951870be0ae4e93f197f26fa788ced0f72a14f6ea171134194ea","observation_id":"e21f3dda-ca92-4b7d-bed6-cd54fdd02776","resolution":{"observed_at":"2026-08-15T18:22:44.794364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.779519Z","title":"Evaluating methods for ground-truth- free foreign accent conversion,","venue":null,"work_id":"0de26f33-893f-4ef5-bda6-22c3b2689f64","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.160307Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:8465716c185cfa339be6eab9ccbd0f1bf3a13e459997a736fadfe40a722efdef","observation_id":"84afe809-a601-4d5b-96fc-2a778d080f16","resolution":{"observed_at":"2026-08-15T18:22:44.783187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.764494Z","title":"Convert and speak: Zero- shot accent conversion with minimum supervision,","venue":null,"work_id":"6d5cce02-9a6e-41ee-9853-2b79b12ff5cb","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.164204Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:5ec44cc4da333c655cd98d6b75044a15c09fb80af7a246415a4c20fa4706702f","observation_id":"b23200e9-efea-48e7-a1f0-7361508c5cb8","resolution":{"observed_at":"2026-08-15T18:22:44.769689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.745681Z","title":"End-to-end accent conversion without using native utterances,","venue":null,"work_id":"435e1151-73c4-4d1f-a1ae-bfe520eb52f3","year":2020},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.168611Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:e91b22709537f09799c58652732b140c3a8af4ac617bbbdf7bc94fa62bf29858","observation_id":"6c3783ac-797f-4626-9910-6166e6be9c41","resolution":{"observed_at":"2026-08-15T18:22:44.750692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.731888Z","title":"V oice-preserving zero-shot multiple accent conversion,","venue":null,"work_id":"0f5c487b-7811-40cd-9264-0bea19f9bb31","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.172533Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:f800872a6f2d982f3e085324b6c8abb72f0a4b9330d1af884de4acde4d7589b2","observation_id":"db5273b6-fe9c-467f-91e5-71e6dadacb31","resolution":{"observed_at":"2026-08-15T18:22:44.736587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.623284Z","title":"Any-to-one sequence- to-sequence voice conversion using self-supervised discrete speech representations,","venue":null,"work_id":"b7733ccc-2079-49d8-86c2-aa1a48d93020","year":2021},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.213053Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:b8f11169d4a4e12e8764b5f9a1ebe841a09518cb04974074a9f9171b75db67a1","observation_id":"551b6c67-9f69-4645-9d52-2f4ed29c0804","resolution":{"observed_at":"2026-08-15T18:22:44.627207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05751","last_updated":"2023-08-10T11:49:17Z","snapshot_observed_at":"2026-08-16T16:09:22.408474Z","submitted_at":"2022-12-12T08:02:02Z","title":"Zero-Shot Accent Conversion using Pseudo Siamese Disentanglement Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05751","snapshot_observed_at":"2026-08-15T18:22:44.180823Z","title":"Zero-shot accent conversion using pseudo siamese dis- entanglement network,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.180823Z"},"links":{"cited_paper":"/paper/2212.05751","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:638feeb365bb124f55ec590e9cce61cdc9db6663c4546501cfc621f1cdecb874","observation_id":"6b8092c5-9d89-4ce0-bad4-e7ae4e99d16a","resolution":{"observed_at":"2026-08-15T18:22:44.180823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.703706Z","title":"Transfer the linguis- tic representations from tts to accent conversion with non-parallel data,","venue":null,"work_id":"5c572a77-3800-4568-a773-0b1f856764c0","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.185466Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:c08f246493acac472d8f4ca9ae0770ef33de12f3bed3c1e7595de85f56cc6e48","observation_id":"7d038398-61a0-4d02-88d2-825e9810e180","resolution":{"observed_at":"2026-08-15T18:22:44.708102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.690513Z","title":"Diffusion-based method with tts guidance for foreign accent con- version,","venue":null,"work_id":"12809970-af9b-4a3e-a6b2-28d25367bb5d","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.190194Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:a03b5283810591607905a5024a8394f121faac84430821307a9f8396ab90f361","observation_id":"d142cc54-931d-431c-8ebb-f9bde4e36cb3","resolution":{"observed_at":"2026-08-15T18:22:44.695099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.197154Z","title":"Improving pronunciation and accent conversion through knowledge distilla- tion and synthetic ground-truth from native tts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.197154Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:c85c9580ff480f0201b4493e1650bde35867cbfb9c3ebd9c02cc4ba370ab5990","observation_id":"f1bb62d3-d28b-4792-bc05-06a1a5adec2c","resolution":{"observed_at":"2026-08-15T18:22:44.197154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.665053Z","title":"Hubert: Self-supervised speech repre- sentation learning by masked prediction of hidden units,","venue":null,"work_id":"ba07bfab-e522-4e73-8543-44b0236e81e2","year":2021},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.201095Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:b876ea66b82cf9cce11bcdbfc43ffd93c6059118f201e7e02379572234f77f5c","observation_id":"93e0bdbd-fea5-4e21-951a-438a3825d7c6","resolution":{"observed_at":"2026-08-15T18:22:44.670664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.649459Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":"b3f47352-3175-4c96-aca6-ff5a2cb621fb","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.205084Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:066eedc79c3081348d7d6fa6d87311863c8f75b7b8ae7c162df0af4f2a003c06","observation_id":"e86603e3-302c-4908-ae3e-1dd560df7a05","resolution":{"observed_at":"2026-08-15T18:22:44.654722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.635838Z","title":"Speak, read and prompt: High- fidelity text-to-speech with minimal supervision,","venue":null,"work_id":"e7da7a76-fe92-419e-a8f0-93bc14fa3ea1","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.209120Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:767558a430f17e8d22187cf2fe83558e336ad95e37b33c23e415edf6e2422a5b","observation_id":"55bedc40-1416-4a90-b941-d2007574abfa","resolution":{"observed_at":"2026-08-15T18:22:44.640532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.548665Z","title":"Total-duration-aware duration modeling for text-to-speech systems,","venue":null,"work_id":"40f84ffd-3f72-4507-a6db-0a10194637cd","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.245517Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:9fa1effb9be816a903aa64641e14463be0a965f9845add199f8b4b391244f67a","observation_id":"006d32be-db8a-421b-9ae4-7978ca7dcc82","resolution":{"observed_at":"2026-08-15T18:22:44.553734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.610236Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"5b33bfa9-5ee3-4146-9823-442adffec957","year":2021},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.217035Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:e9de68d54f54188eaaae130de4314d29e66a1cebf8f81289cd81a3918a29bb5f","observation_id":"e3979e28-8e47-487a-afcd-bfb7809cb329","resolution":{"observed_at":"2026-08-15T18:22:44.614580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.597430Z","title":"Direct speech-to-speech translation with discrete units,","venue":null,"work_id":"625882b1-828e-48d5-b235-c263ab0a8b16","year":2022},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.220809Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:3a9ae1cd4e4139b77e8116b97382104f54ab9a0a048922583ffa6f5c3af2504a","observation_id":"4c4142f0-b2f0-4b25-a19e-04e235711b2f","resolution":{"observed_at":"2026-08-15T18:22:44.601000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-15T18:22:44.224384Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.224384Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:f9f54081399046b8ff4eb92314b07a767d72d491831e1cfe3f004530745e572b","observation_id":"e8048819-f9d5-4b44-b9d1-b147f6b4654e","resolution":{"observed_at":"2026-08-15T18:22:44.224384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.228599Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.228599Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:8c4944d8f212151cf12c6baaff5a799c59e5a723d03a10a035f0f05a742933c3","observation_id":"423988f5-8d12-4902-9d89-7fd51d4dbd8b","resolution":{"observed_at":"2026-08-15T18:22:44.228599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.576963Z","title":"Matcha-tts: A fast tts architecture with conditional flow match- ing,","venue":null,"work_id":"cb73ae1f-0649-43af-ab2b-66c9a520ee23","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.232685Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:0ca233ab18fb216210a6566ea2e33c63b094320016b4917f7af19ae01a18a678","observation_id":"83a8a10a-82d9-4573-a6ce-06880d9101a2","resolution":{"observed_at":"2026-08-15T18:22:44.580887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.563471Z","title":"V oicebox: Text-guided multilingual uni- versal speech generation at scale,","venue":null,"work_id":"47ae3358-907b-45dd-aa88-30c4526fcb0d","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.236919Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:2112a3295905ba34311e0045439965558eba4ac0e4534877945f1031567519ec","observation_id":"7c256243-c2ab-4ad1-973c-c11bbec24b54","resolution":{"observed_at":"2026-08-15T18:22:44.568032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-16T14:12:35.270314Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-15T18:22:44.240684Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.240684Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:8987b1a997feb9bfdc3fce55650946505b8426d4bdb6b58b58e8a6f657863bfa","observation_id":"bdd2d72a-4063-42f1-a544-cc44a7258273","resolution":{"observed_at":"2026-08-15T18:22:44.240684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.456303Z","title":"BigVGAN: A universal neural vocoder with large-scale train- ing,","venue":null,"work_id":"80687151-0b77-4f63-a4ec-55b29ce81f65","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.275275Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:85e1506a95cc12ebd631d9323628a11f947b7da2c752dd939de46e49d1cbb0ed","observation_id":"0b4172e9-2304-4f50-9151-bdf4a2a31eac","resolution":{"observed_at":"2026-08-15T18:22:44.462267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.249157Z","title":"Con- nectionist temporal classification: labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.249157Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:2a270d9543007ca67e931d412fca37c809853f40290218ceaf82316c1110ba9c","observation_id":"0b6bffd0-dac8-4212-ace4-2871341eb0e8","resolution":{"observed_at":"2026-08-15T18:22:44.249157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.525743Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":"6d7aeddb-1be6-49a8-a0b6-9209a3e70864","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.252601Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:f35edc142ec0055bc2ad2a13387047d87e19dba12bcd3eac2fdfbbff57d6f03f","observation_id":"4e72fc23-1160-4ee9-b1b5-a008c93ea0a4","resolution":{"observed_at":"2026-08-15T18:22:44.529971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.511842Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":"82e835d7-439e-4ade-bfd4-ab03fda4a1c0","year":2021},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.256067Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:c4bb6d053aa671e118fa20ab0c93aa8d89b89fc15059545238e2e757e7000c68","observation_id":"0adacf96-3d6a-4f60-a1f7-af1be2a10191","resolution":{"observed_at":"2026-08-15T18:22:44.516669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-15T18:22:44.260003Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.260003Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:67faf22655583ac3a9cfefe820edfd36602ad7fb2073b3c01106d0b0799cc8af","observation_id":"ecfd3872-f8cb-489d-8213-21facddd9760","resolution":{"observed_at":"2026-08-15T18:22:44.260003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.497994Z","title":"L2-ARCTIC: A Non-native English Speech Corpus,","venue":null,"work_id":"72ad1023-33a3-46eb-ac8b-8c5e8c7fdc65","year":2018},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.264013Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:d315cb68a5d4d37f67009775491a2ed7e49357c693ed1dcea128f922bf1271a4","observation_id":"94b5de5a-852e-49a6-85b2-644bcf701d94","resolution":{"observed_at":"2026-08-15T18:22:44.502999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.267499Z","title":"The cmu arctic speech databases,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.267499Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:55312cc4a9886218b8092de5fca1e0c0faeb4177dc2856686ab5942bc53b7280","observation_id":"7b0b4078-4262-407b-a87d-79539a1e670e","resolution":{"observed_at":"2026-08-15T18:22:44.267499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.473705Z","title":"LibriTTS-R: A Restored Multi- Speaker Text-to-Speech Corpus,","venue":null,"work_id":"c610f2ab-67eb-4224-97c2-82a0ec69ba8f","year":2023},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.271356Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:e96df56a747ab6f4198e2ffdf7a08b99693b06e860de6452d78fd23102561bc3","observation_id":"104e2eee-112c-4e41-a0dd-99ee5bb95dd9","resolution":{"observed_at":"2026-08-15T18:22:44.478485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.441631Z","title":"A comparison of best-worst scaling and rat- ing scale for timbre characterisation,","venue":null,"work_id":"9b747730-ac30-4321-bbb2-16c692bc2d6a","year":2020},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.279511Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:1c4a5cc8d907bec292bdc8fbfe025f4a0ee9bf53c55b72272be0a358c7036030","observation_id":"02a47713-f3fc-4baa-bec3-3b3674e4d73f","resolution":{"observed_at":"2026-08-15T18:22:44.446484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.428595Z","title":"Accented text- to-speech synthesis with limited data,","venue":null,"work_id":"ad770ba6-c8fd-435f-9578-bdbadc4e0a14","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.283851Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:e0677347829b7c5451cd2496316414ebf5b20ef6db751aea7b4c2cfdd55e5a62","observation_id":"ad93342e-3a1a-44cc-9984-769c29c4149b","resolution":{"observed_at":"2026-08-15T18:22:44.431990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.417409Z","title":"High-fidelity neural phonetic posteriorgrams,","venue":null,"work_id":"b11d70ae-daa6-422f-ab80-b1fdcbc97379","year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.288042Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:994da979e72916330bd1fa08c0dbd398985d1fb75d05ddab607d69d77e218752","observation_id":"edb3729a-033e-4092-b760-c0560e6bf426","resolution":{"observed_at":"2026-08-15T18:22:44.420760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:22:44.951616Z","title":"For synthesis, we use flow matching [28] with Resemblyzer 5 speaker embeddings and BigVGAN [40] vocoding","venue":null,"work_id":"7eb714f6-4177-440b-8e75-bfd699eae4a8","year":null},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.097538Z"},"links":{"citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:5a3c5cce7a59525c76c1fdbc253c2e147bf015c2fda1022bc06e3179d373e5fd","observation_id":"686d8b5c-22fb-4a54-9f79-fd258e4ec75b","resolution":{"observed_at":"2026-08-15T18:22:44.956276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T18:10:00.503083Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":40},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2507.17735."}