{"as_of":"2026-08-08T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b30d857a88353232485df2f8423fe46cc4ba976e620e75c7179340ec6c8dcf52","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:58:27.449735Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03928/citation-record","integrity":"/paper/2607.03928/integrity","json":"/paper/2607.03928/citation-record.json","paper":"/paper/2607.03928"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Foreign accent conversion by synthesizing speech from phonetic posteriorgrams","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:3e8a574bde50cf08c1dccf5693e9e20cdc64b1dc88ec5eadbdfbd93346c5cada","observation_id":"074ad78a-7a56-4abe-91f1-dbf1495cf856","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Foreign accent conver- sion in computer assisted pronunciation training,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:ebc68b04b4109e02d8d61f6b955f4392a8b702f0b37f8353e26d3d769dda8b26","observation_id":"7919503b-bd8b-487f-953a-a67ba4037d07","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Subband based voice conversion","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:d7ecc38767deca1b554bc2da45808266c72c43dee88121e908b2d7a924a52ff7","observation_id":"87fa0dd0-52ea-4def-8aae-ec80ba227cbd","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Personalized, cross- lingual tts using phonetic posteriorgrams","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:b833b5c77ba42aea6cab3e3f6bf97d7ad051b0578c2c7d9d34c7bd2c73bc2606","observation_id":"4a00cacc-46d3-4e67-9884-dfaab3152a17","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Accent conversion using phonetic posteriorgrams,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:e859df586858e0ae4777ef91c8b435ea9c52003881e7da51da34531089f28494","observation_id":"6ff375ac-bd1e-44c5-a018-7fac4dea7d8c","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09271","last_updated":"2020-05-19T08:09:58Z","snapshot_observed_at":"2026-08-08T04:52:38.768717Z","submitted_at":"2020-05-19T08:09:58Z","title":"Improving Accent Conversion with Reference Encoder and End-To-End Text-To-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09271","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Improving accent conversion with reference encoder and end-to-end text-to-speech,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2005.09271","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:c422ded93f65e0e7ecf319a4669bd2c76b4225344cbc120debd0ff736bab6160","observation_id":"09ce1fa3-b9b5-4336-a7e8-785bd0bfd7ca","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Accentron: Foreign accent conversion to arbitrary non-native speakers using zero-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:9e9625c02370ac5a33a42239a17dbe96f912a93c19707a50addfdcab6d157377","observation_id":"186ed197-6104-4806-888e-f583890f4234","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Vevo: Control- lable zero-shot voice imitation with self-supervised disentanglement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:b30cc103e4c1267b723c9f47413cef070246a410a9757756b5adde89df3b0250","observation_id":"27be2d3d-f1ab-403c-ba20-41f524bb2ee7","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Converting foreign accent speech without a reference,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:ed68487a9c42011de3a7af5c056a5ff0c75fed95acd612fbbf1ef868172efa96","observation_id":"158b673c-3712-45c1-b99e-e78ab7813fe4","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Accent conversion using pre-trained model and synthesized data from voice conversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:a2fa6fe4a6ad117ae04982ac7b406bb515e294cf3a0cca95ff896173ed7fe30c","observation_id":"39ad60c4-67d2-41a1-8b68-cb44d6b6fab9","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Zero-shot foreign accent conversion without a native reference,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:b8b1facc69d938a0cf63faa16641c84eb5f5c1a4b5e830f88a066f6e66ed4e5c","observation_id":"2581cdb3-85e8-4934-907d-aea0a1cb3af3","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"End-to-end accent conversion without using native utterances,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:25b0623a33034ca8d9023c3e7c4040bf7c7bbcbf088fb9279ada0b2fc9bbc809","observation_id":"c6c7199d-8c8e-4a52-8c5d-ba40a1706685","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"V oice- preserving zero-shot multiple accent conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:9026c924c8f49913441248edcb89473616be82cf5722288ba539320b351120e8","observation_id":"933e74ec-4179-4a57-8892-74978113acdf","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Tts-guided training for accent conversion without parallel data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:305f819471a18be28d8daf6397374263f780a7aae1b8932701ddda1f6d0fe572","observation_id":"c98be191-48ef-4fe7-8c4d-3dce81dcf0ec","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Transfer the linguistic representations from tts to accent conversion with non-parallel data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:f66c4f0a86469797466939af21be3af421927b59fb12645ab0b43a71ea485e4c","observation_id":"87e22484-a3a4-4004-b399-7756b1bb8cff","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Diffusion-based method with tts guidance for foreign accent conver- sion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:304d2dd155aac7ae2246070a8ab117cb8bd977c7d1445177876671a159095057","observation_id":"dfaa7b54-f1a8-4438-9685-f5155d3daf8a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Improving pronunciation and accent conversion through knowledge distillation and synthetic ground-truth from native tts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:44c20f513433a642723884beeea3440ddd1ce7576930d906fc8e0bd2ad31985f","observation_id":"28f74490-93aa-418c-9178-e4c65b0f85cd","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Convert and speak: Zero-shot accent conversion with minimum supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:61e03e77d8468f44e4def9c5dfa195594187adfb1c2be0539b728618a9af91fd","observation_id":"19ceb256-865f-4c54-8c07-f1ceb2768d2b","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:2a3c80692f94bbe1da18b6a89e5f994de42a0ea5969a2e4438235305476b05a3","observation_id":"50b6b147-6632-455d-8a68-36e690440c64","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:8e496978873e117da0de3eed3606eecde0b1d8391705577c511cf69eec368cc5","observation_id":"f464a9a0-f335-4bcc-a05d-83b4dcc10b39","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:40aeab84c757b47de826b2e4626508f93ef85fdb4ed8d9afc6b07019dad55b6d","observation_id":"941b0aaf-c9aa-4cf2-9c48-2ce0aacbaa30","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:f10b9ecf620cacf456fefb09ca4a5e2872eb72832bb4f634a5d9a5a45439a377","observation_id":"2addf8d6-64c3-4f91-aced-2fa35659832a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:f5350ac2a89815a5c3e6ab2088157b229f1f565b027fd42c8275092d74779a35","observation_id":"ccd3e735-b6e6-4367-b0bf-3942c3c1e25a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Accent conversion using discrete units with parallel data synthesized from controllable accented tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:568f792c7957fdfc7c298effa88feed9742dac87b401bce69a906180c19bc26f","observation_id":"b43622a8-11bb-4ef6-9c43-4c1ca758b30f","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Accent normalization using self-supervised discrete tokens with non-parallel data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:8e688b943c1e316a03ae97f11a8e3933aed6968539713cebedebf9b8cd3e622f","observation_id":"ef111922-0620-4947-a95c-79cfc308c3ba","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:779fe6b1a8a1f6284e49b3841fa299fd4b2f3aa5f44759d53e33a5cfc662ea4b","observation_id":"e4f1d709-e018-4144-bcaa-63ef10663601","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"L2-ARCTIC: A Non-native English Speech Corpus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:32a784bb20f1baeb491c5d098ac1643a3d38d74f4be8d9fdd0d714480d8e07dd","observation_id":"f2a57529-46bc-42dd-9d10-7f4bcc210f15","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Cosyaccent: Duration-controllable accent normalization using source-synthesis train- ing data,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:09457af6994fec86fbe72d7287162fcb95ac1d4313f4fc4ba1efa49a26be239b","observation_id":"d306acef-da72-496e-b36d-bcf7321ed14b","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Evaluating methods for ground-truth-free foreign accent conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:40a7dcb8747349ce1e37af1d575b4ab13f8903509338f2f8e60a9562890d1ca8","observation_id":"c62e4b77-b73d-445f-9f5b-3261687116d0","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Fac- facodec: Controllable zero-shot foreign accent conversion with factor- ized speech codec,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:59834e24e4e35189eae29da9869ba475535ecf401da8468e03ac7bd3861b622f","observation_id":"4939373a-50a8-4888-865b-d4ba112ebb01","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Any-to-one sequence-to- sequence voice conversion using self-supervised discrete speech rep- resentations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:43c15cd7ad34ea8389a50ae47d93ab0a7ecce67c5796a4c384422e44e4714540","observation_id":"17700096-1bce-4046-a9ec-70f1e49687b8","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Speak, read and prompt: High-fidelity text-to-speech with minimal supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:e2fa61ce22f7f8e83e227102ce37069a74af493454e2745e16262ef2678acbd7","observation_id":"116c96e2-d9ab-429c-80f6-0ed848db004f","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:1e8c36ca1991877378a13f51977ea3de38b8cc95787e54a3dbd44b40f46ec68d","observation_id":"ad085ab3-9f44-4f3a-b303-a0df36c0f75a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Direct speech-to- speech translation with discrete units,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:d181a8544a72d2422d0de2fcd404591713b33c02a6568ce161d0f3b37341061d","observation_id":"8c2d2ce4-5ad8-40d6-bfb2-03e0c6f4f867","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:2b9e60f6f8de0a09daebd747360a5f3e30b11d3ec3a787d6fa3b1728b42557a8","observation_id":"a130e201-e309-4fdf-bb17-135aa45b6047","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:99b1c5c907422e9fa7bda090fa543933afb1008637a56edb97dd6447a8b1c988","observation_id":"b157ec2f-ba50-442f-9077-63590cf4212a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:c9a9c5bc5ea34bbaf1f5f8fb124b5d65138e58cd7fc8c465d0bad8fbe2f0bd74","observation_id":"c18cd026-6178-414d-9745-84a69103b0f4","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:b14d2ac4cb32fc96fd494b38514f6655e58d09c55c4788be24459386e991bb29","observation_id":"9b97e921-b519-4960-ba94-85616d24910a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Matcha-tts: A fast tts architecture with conditional flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:c81bb84a53b6d6a65ba7eb5775a3346c9c08402a1dd159d606e92676f8cd6fb4","observation_id":"2dba284c-1f85-4d9a-8ec0-341ccadc4a07","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"V oicebox: Text- guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:69d6a962b2c046ec0f34ae41fee76cedd81916f97a4a1472e6938d08111009dc","observation_id":"74bd6d07-d215-49ee-9028-9d8e3e9dbbb4","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:9f0d204d63572cc4f919f11ef1d1e3672747a8494ec5ef6c1c37b81af8302a2b","observation_id":"4f76e9c6-3349-4df9-a5cc-8cb5600df6de","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Total- duration-aware duration modeling for text-to-speech systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:338abf3a7abbf2a62430daf40d9fc1db0af335851d9a2ac3946f69ad58be487f","observation_id":"583ca04e-88aa-4b6f-9be3-b3e2b5e19865","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:af2c37bb1896e24af9f6b0fc5f430063c43b8f2e6756a06e01382227ca644784","observation_id":"99ffa8e6-3877-481e-91b9-036198a4a82a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Group relative policy optimization for speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:51262d9ca971076d6d8d19c8b136c9e4c9fe97abe58ee63272b685f9db10be71","observation_id":"d3e70b09-04ea-4c7b-9e7c-4cbdad581494","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:26db21b92d8243ee39b78174d2a309892381dfb65d9b5a0f285e7a64deb77513","observation_id":"93f51340-2c8f-42bf-8208-adefc7efdcee","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i38.40450","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dmospeech 2: Reinforcement learning for duration prediction in metric-optimized speech synthesis,","venue":"ArXiv.org","work_id":"b7fc8c15-1a65-4b61-82d6-3204edd8b8d0","year":2026},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:b296aa3d4d35b5cc9882854be5c5a099629922db6be8d2ae99031c138175c04e","observation_id":"a2fc2671-6920-4029-b009-6d54cb33a8cc","resolution":{"observed_at":"2026-07-11T23:08:21.667101Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:19:34.478102+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:19:34.478102+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:af44a0de6e458897dc636b7d292b4cf36f703f0d7e0606e01a74a193f317c7aa","observation_id":"28fbc2ab-04d0-4da4-b1bc-1611e12afa4c","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:8dd78a809e5b307606e666a29db64c2fa60d3268622df9a351d2de462d006fcb","observation_id":"b985e1da-a11c-4068-a91a-4b070c8403dd","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Roformer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:d1c021a4719a9e1a369d2a0bc0bc8bfe162fa58deadb9d751e94f07ef7a00d5e","observation_id":"a5654a8b-a98e-4725-b2dd-098ac5cf8eb5","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09493","last_updated":"2023-09-18T05:30:15Z","snapshot_observed_at":"2026-07-06T16:19:45.746334Z","submitted_at":"2023-09-18T05:30:15Z","title":"HiFTNet: A Fast High-Quality Neural Vocoder with Harmonic-plus-Noise Filter and Inverse Short Time Fourier Transform","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09493","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Hiftnet: A fast high- quality neural vocoder with harmonic-plus-noise filter and inverse short time fourier transform,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2309.09493","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:d4a52f838423637e5e2c2fa1dfa41d042de1a666e79b5a69684e5b08618b1368","observation_id":"a6297c80-a820-4125-aa38-519ef75fe7d3","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:b2b4039b52f65bede2bd19081d14e532db6344590640e0aa1daaf55ae93ca379","observation_id":"16ac4dc7-c07d-4922-8a32-09f8236e7b3c","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:91987566b9de91066ffa71f58e9c7c6cadd5524040673ec7945ec8c3f9244e7d","observation_id":"e6998574-cf37-4df8-a500-b0ab11a7d03a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:76c23d07ed2eaf2ea2a8b86c2e0428cde6b4bc4fcb96093dbbd24476ee37c77e","observation_id":"f6ebb85a-a923-4026-a14b-2e5b1f76af65","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:da33c7dd9a9eee1ab1d0c0fcee8a2092f9b79510582676223876c1a355ecfa5d","observation_id":"bab2d095-1b49-44ef-ac8a-a78fd6a8f5d7","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:18b9e4f6317943bd45eecdf01b5af4e82377024160b15920eea5d81de11de386","observation_id":"eb3be712-cb5b-4d6a-afc5-fddfc33fa0ed","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:a383adc293ad2d85f827c58dbd50836aae9ff03e3c2ad2f56e451e5dcb8e6ea4","observation_id":"32774286-2cb2-44de-8eef-48d367269dc1","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:3958bede9f4ba92d74a3fa6be79dd9b3104da74bdb9212e100e502865c63aeab","observation_id":"4bcf9eea-ddaf-4dfa-a760-9b904c458b7c","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Connection- ist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:8a52732c0da5071ca93011baaa60c3fb8fd01588c3be427417d4e618af54018f","observation_id":"e1c01422-40c3-4ab3-adf6-ba59ec250f5f","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Bart: Denoising sequence-to-sequence pre-training for natu- ral language generation, translation, and comprehension,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:363c24a04739e8c2699ef16edc0fb5b8b15e2c89da5b3a91288782e087b9de1c","observation_id":"2a67accf-03a9-4bbf-9365-e31f888595c5","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"DAPO: An open-source LLM reinforcement learning system at scale,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:2e57c492442cd96d2911e4ee7be14c3ce454b79c7fbbd0ff1856f9b701c0b336","observation_id":"512e4cfc-3c80-44a4-81b1-c2d973cca182","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:c2185eb2bf4e7b30ae15666f259240a40adf63412bc96a6c83372bb6fbb13a65","observation_id":"4605241b-b83f-443f-872f-53e3b60ead3a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Com- monAccent: Exploring Large Acoustic Pretrained Models for Accent Classification Based on Common V oice,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:623b42dee2ba8666001b749b7c61849fe855b77025abaadf954bc54d6cd5f9b3","observation_id":"d89b01b5-6631-4332-9f0f-f279de943cf2","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:65c711952ac9cb32f3a61ee8d3d392fd72c7a415a9377a1a6b550ba56bc93cb2","observation_id":"b351a1d1-eaa1-4634-b124-1d8acc53f432","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:e057be7ac34fa88101502241947c489aa61e26985e5af98cd2d8cb243ea278d5","observation_id":"155cfd64-b754-45ce-9901-3333797b27d2","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"The cmu arctic speech databases,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:e9e9ff139c0aca2f89fcdba4a39c9daecd19fe6cb22d60d0f9305440b0b0b450","observation_id":"8becd556-ce31-46db-b81e-ffeb64d487d0","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:f588631299bd2dbccaa57203da4663606f2be76a7fff09ef02213a7dac4d4372","observation_id":"24d521dc-5fa8-4f3c-9c56-b08285c93d1c","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Bfa: Real- time multilingual text-to-speech forced alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:c4e85e8abcdfda15fec8d1d47f2b453a2eb89a1d6b7ea0eb87ebaf5b65f50ff6","observation_id":"4938e5fb-8b08-4012-9cda-adc7dce563fa","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:6519ca7db0a656e484cb0a846aa264a4972616ed896f8e77419ddfaed82b279d","observation_id":"f1b14742-0654-4f34-a310-4df802d2160a","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"A comparison of best-worst scaling and rating scale for timbre characterisation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:9337e10c978dc188267ae94e756187e810001d2aa5a7e30cf8dedaa17d62a289","observation_id":"0930dcb2-32cd-434c-ae88-16be0304ab48","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"The t05 system for the VoiceMOS Challenge 2024: Transfer learning from deep image classifier to naturalness MOS prediction of high-quality synthetic speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:e98aae421a07cb3912dfafa8f0807c86353cd7c153aa44661b3ce08573624bff","observation_id":"640d0203-7ff2-4800-ae54-912bb46967e0","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:b12e0d7f4e7f3d38ea8c0f336f013e2ba05e823a799448923a1590029026a90c","observation_id":"99ba0f15-0e79-4f3f-931e-6fc892b363ad","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"High-fidelity neural phonetic posteriorgrams,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:86eea3cede029c1ea626165cb1a4c5219a292107945505d177279f9a453a38f2","observation_id":"583cbe99-ad68-4af9-9d60-9313843e8350","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Exploring ssl discrete tokens for multilingual asr,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:9844ddbec98dac7ecafd984a4e14a0fe33400d45193e1010d5f47d8f2a459624","observation_id":"e9d3a208-51a2-460c-8dca-ef50aed6d4b7","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Towards universal speech discrete tokens: A case study for asr and tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:0fb30fd49c888674f2a54df57b448d36f875ecdefa964c37f703a4060363efcc","observation_id":"356384d3-f1a0-4f4a-92bd-721a0862fef9","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A comparative study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:f2fbaf734ad026c1de94999dc1858b884911c62fe8ce95b746282479fb314f6f","observation_id":"fffe06c9-7956-48d9-8ad6-c2c6048d923d","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Codecmos-accent: A mos benchmark of resynthesized and tts speech from neural codecs across english accents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:22884cdff2e7040d5d42670606a8ab4319d72b1c7d5d60c66c9d655bde78fad5","observation_id":"fecae4a7-6d80-4247-9c7d-9c020be60fa3","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Montreal forced aligner: Trainable text-speech alignment using kaldi","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:ea2512aa9f9df99f78cfa7cc62aba986369a9af7d2d3683359e2a2fbb0f809e9","observation_id":"5d73e881-3b89-4247-b2a3-6582851bac86","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Duanmu,The Phonology of Standard Chinese, 2nd ed","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:d6e41db0740618cbab3a94131bd7a9b2e2c2a4ef5f7966d7130dbbf1478d3aa9","observation_id":"32566a22-3d21-4afe-9932-a6abfbbc8e1f","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2607.03928."}