{"as_of":"2026-08-08T02:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f69b4f73af4d7c892407c8e324ce98a8ebd291ef4b349a870dfa0e8e878fe5c1","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:15.786786Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:15.390168Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T10:45:15.943522Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"cited_work":{"arxiv_id":"2506.04527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04527","snapshot_observed_at":"2026-08-07T10:45:15.943522Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","venue":"cs.SD","work_id":"9ea1e1a2-6160-40cd-a1bf-1ca7b0347076","year":2025},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.390168Z"},"links":{"cited_paper":"/paper/2506.04527","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:907e9e85cbd8ebf4bc3496c1efa114f651ae95103867c361a9853fe93ea8354a","observation_id":"3828ef2d-8103-4827-9723-0e4ff294770b","resolution":{"observed_at":"2026-08-07T10:45:15.953103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04527/citation-record","integrity":"/paper/2506.04527/integrity","json":"/paper/2506.04527/citation-record.json","paper":"/paper/2506.04527"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.962205Z","title":"For training high-quality and diverse-styled TTS models, a large amount of text-speech paired data is re- quired [4, 5]","venue":null,"work_id":"3e74e6eb-3de8-497d-b060-1e0cc29c4211","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.376258Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:d7a6f218da7f4a6f20c7a1150781fe86b75909e4c1e8f8f4a648ef961fabaf66","observation_id":"8d183f01-308a-4a4d-b3a1-f50a73b0244b","resolution":{"observed_at":"2026-08-07T10:45:16.968584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"cited_work":{"arxiv_id":"2506.04527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04527","snapshot_observed_at":"2026-08-07T10:45:15.943522Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","venue":"cs.SD","work_id":"9ea1e1a2-6160-40cd-a1bf-1ca7b0347076","year":2025},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.390168Z"},"links":{"cited_paper":"/paper/2506.04527","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:907e9e85cbd8ebf4bc3496c1efa114f651ae95103867c361a9853fe93ea8354a","observation_id":"3828ef2d-8103-4827-9723-0e4ff294770b","resolution":{"observed_at":"2026-08-07T10:45:15.953103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.942299Z","title":"<blank>","venue":null,"work_id":"336f19a6-be23-489e-a8c6-cce5702acc9c","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.397152Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:c872cd1df3cff7186d1a8cc46f469075df8e03d816b17d842d301834580a7812","observation_id":"d83c57ff-e9c2-4051-a2b8-5ffde5a2fcff","resolution":{"observed_at":"2026-08-07T10:45:16.947649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.922393Z","title":"Evaluation of proposed annotation model 4.1.1","venue":null,"work_id":"38e1333b-c89a-4e18-a05d-823eb64615d5","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.408097Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:84256de2eafbd155324e2940735d0476816ce223f51a98e34aca4c7d9b00806f","observation_id":"283541ee-6f26-4a93-adb5-f166d39e8b93","resolution":{"observed_at":"2026-08-07T10:45:16.928154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.898298Z","title":"Specifically, we utilized the basic5000 subset along with its manually annotated TTS labels1","venue":null,"work_id":"527149c3-33f4-484c-9e2a-10c0c4b4dffe","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.416347Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:68013bc82a2e5289eb93d553d6584c54f7c59e80d724fadf5cdf8de1c5ea48bf","observation_id":"dd5fb3c8-6404-4130-b3ef-a50ee30c9db0","resolution":{"observed_at":"2026-08-07T10:45:16.903592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.877459Z","title":"”, (2) Accent change from low to high “[","venue":null,"work_id":"d512852b-fc07-4a46-8022-ce06a9d90bf2","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.422376Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:00da2cd512f110075c1f45d1880cb24ef9e9aad5eaa2fbab99f0401579858545","observation_id":"88bb5455-04e4-464a-b6ce-7b7f26498546","resolution":{"observed_at":"2026-08-07T10:45:16.884422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.858145Z","title":"Applying this method to downstream tasks be- yond textual accent estimation is a challenge for future work","venue":null,"work_id":"c02e258d-148c-48b9-b6a7-29987faa75d6","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.428341Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:da1a2f6e783eff8e24fcde535318b0a9df57ee632addaeca0adc13e4e33bb2ef","observation_id":"8a7ac17f-3c7a-49fd-b1c8-b4a1f7ba2937","resolution":{"observed_at":"2026-08-07T10:45:16.865438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.837097Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":"03b4d096-f09d-4101-b759-9dd05912b472","year":2017},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.436595Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:ab1f0b61468ac08625d89e90813aee0a901c2282f796fa13101bfd0acbc4af5b","observation_id":"471f62fb-b9d2-4ecb-8445-85cff0353220","resolution":{"observed_at":"2026-08-07T10:45:16.843284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.813407Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"ffaf3157-0855-4160-82b5-adeedf13b04e","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.444523Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4e4126dd1bc8b8eb8fc73840b0fc7f9c3d931eae4e05a72a2bfea3f9bf63cc80","observation_id":"0d18b20c-8ab5-4230-87dd-921714906ef3","resolution":{"observed_at":"2026-08-07T10:45:16.820773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.794101Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"757b737d-2ae2-422d-906a-af0a769bcf11","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.455133Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:8e5bdb2aeb82d1abba20c775279c6462c53dd1ea99917b5626cd7dceff964cf5","observation_id":"76c0dd0c-e7cd-4f32-8924-f033a51a921c","resolution":{"observed_at":"2026-08-07T10:45:16.800603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.775012Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesiz- ers,","venue":null,"work_id":"a4cd82a9-49ee-4c02-a637-68a2c4f365f0","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.461525Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:ef21f3ba1460fc569409ec9764f64b175f4581e2ec0d79097227c3e18a120804","observation_id":"30c4032d-9850-4d5d-b62e-ae3728234cc1","resolution":{"observed_at":"2026-08-07T10:45:16.780616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-07T10:45:15.469169Z","title":"Mega-tts: Zero-shot text-to- speech at scale with intrinsic inductive bias,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.469169Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:bb04e457163f180b71463001767547f4fc83ccd21da70611857448143d2fac73","observation_id":"b78bc22a-fcd7-4a2c-84c2-66b3954ae4d2","resolution":{"observed_at":"2026-08-07T10:45:15.469169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.755251Z","title":"V oicebox: Text-guided multilin- gual universal speech generation at scale,","venue":null,"work_id":"f8ff8018-84c8-4711-8cdd-fabfdaa40a64","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.479055Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e72535ded0e6f6d8aab486c573b676f1bb1a2587c1c40d7c7bda00b5e35eee46","observation_id":"f942b0ff-5a44-45d4-8b9d-f6c1fa025cb7","resolution":{"observed_at":"2026-08-07T10:45:16.760835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.735300Z","title":"Listening while speaking: Speech chain by deep learning,","venue":null,"work_id":"ae9943cc-d0b6-4be7-97e1-ebc85e306ea6","year":2017},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.515750Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:c27c095a5b075c242a762e6ec9820f2412100bdf17f745c87440b5d219638f0f","observation_id":"bc11e927-d6f0-4d57-8504-d2201b043660","resolution":{"observed_at":"2026-08-07T10:45:16.741415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.714790Z","title":"Almost unsupervised text to speech and automatic speech recognition,","venue":null,"work_id":"98feba44-adf3-4322-a3f6-6381a24a7007","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.522695Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:726816ad95d975f4ab099b063ee6aecacc2b522daded6ff00113d8a61d14240a","observation_id":"868b8ddd-ff18-4177-8dfd-146abb81dbe7","resolution":{"observed_at":"2026-08-07T10:45:16.720787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.695361Z","title":"Prosodic features con- trol by symbols as input of sequence-to-sequence acoustic mod- eling for neural TTS,","venue":null,"work_id":"5357f408-dd6d-4cd2-a944-ed38caa4def6","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.530970Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:bca1cf295777be0ad966d5a74a0c24780119da8d598dc014126ad3b066b5a1a0","observation_id":"f8a5af9e-90d8-4ad9-a796-5392a21170be","resolution":{"observed_at":"2026-08-07T10:45:16.701489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.672427Z","title":"Investigation of enhanced tacotron text-to-speech synthesis systems with self- attention for pitch accent language,","venue":null,"work_id":"21989e11-8323-48e5-941f-785298b1dba7","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.536055Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:d81ecb5b58b9e44c7895e0a59ee9c985144de5506ad0b97d5112a392e74b5058","observation_id":"ef53aded-23e9-4299-9d45-52066e46cc17","resolution":{"observed_at":"2026-08-07T10:45:16.678475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.638982Z","title":"A unified sequence-to-sequence front-end model for mandarin text-to-speech synthesis,","venue":null,"work_id":"9b0ef646-eed3-4f3b-82ff-6239b234c97b","year":2020},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.543348Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:13ebcd63e5cad546ea1f3a424b5d37c19d3a1e35f2ce2b520765ba9a5eb30738","observation_id":"c08a13df-5cfb-450e-9d4b-c0447b39af09","resolution":{"observed_at":"2026-08-07T10:45:16.646962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.613351Z","title":"A unified accent esti- mation method based on multi-task learning for Japanese text-to- speech,","venue":null,"work_id":"f842f163-a9a2-49ea-97d1-64bd2ce5874c","year":2022},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.549588Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:7fb983bfd20a7f401492110de922850cf4fcaf2568666833a87395d2b9cf2d21","observation_id":"9435527f-a9d1-4d16-9010-aa869e1c7848","resolution":{"observed_at":"2026-08-07T10:45:16.619564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.591191Z","title":"Polyphone disambigua- tion and accent prediction using pre-trained language models in Japanese TTS front-end,","venue":null,"work_id":"59f61576-a25f-4199-9920-533d8c2b41ca","year":2022},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.555619Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:024e991ee57d3a3b9e0522886010569efe7a9eff2adc407d159739d3485c8820","observation_id":"a50ed950-a929-4c7e-93a5-db966a4ba857","resolution":{"observed_at":"2026-08-07T10:45:16.599984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.564277Z","title":"Enhancing Japanese text-to-speech ac- curacy with a novel combination Transformer-BERT-based G2P: Integrating pronunciation dictionaries and accent sandhi,","venue":null,"work_id":"1d8d3e0f-86e4-4cea-a40b-b3055ba0fcb0","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.565465Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:635d31ad7fa09c5bb580ead24771c50a4479f1ddeda2699d5c23507cc55764f6","observation_id":"f3392d7b-db93-4477-98bf-158eef3a6723","resolution":{"observed_at":"2026-08-07T10:45:16.570769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.539399Z","title":"Audio- conditioned phonemic and prosodic annotation for building text- to-speech models from unlabeled speech data,","venue":null,"work_id":"9ea27be3-8410-4f4c-8719-388949fca027","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.572435Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:24f51fa4750f14cdc8908e482a0dda35c7a4fea6d616d778d6781983e0467e38","observation_id":"f552c249-4b3b-47c8-8c9d-4d3c2c4c0196","resolution":{"observed_at":"2026-08-07T10:45:16.544361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.510447Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"50e0ac55-5cb9-4ae8-8c79-be9f8ed892ed","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.577753Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:63ed1b6be78515d3d96a7b37652e19eb1a6b94a5c1797c6b9fbf2df2b75d49de","observation_id":"d1ed3e51-589b-422a-9cc4-5904314ad472","resolution":{"observed_at":"2026-08-07T10:45:16.517621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.487041Z","title":"Reazonspeech: A free and massive corpus for Japanese asr,","venue":null,"work_id":"5ee7db20-1733-4c68-b0bf-98d2cf757a50","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.583381Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:ae328b3e4c9af6814db5a4d2feef067f85831cac8144f5286834d1df3e4654dc","observation_id":"c724ebc8-0b5b-4c22-b3c5-84e02602b416","resolution":{"observed_at":"2026-08-07T10:45:16.493668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.463964Z","title":"YODAS: Youtube-oriented dataset for audio and speech,","venue":null,"work_id":"081170a8-3b02-4471-af2d-45f8fdf70448","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.591574Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:fcc0e04cebc8bbdddb0bb2c622e041774052a792224ed4dca52c494dde35e329","observation_id":"6e54d56c-00de-446f-88a5-9df6dee64ba7","resolution":{"observed_at":"2026-08-07T10:45:16.471599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.431631Z","title":"OWSM-CTC: An open encoder-only speech foundation model for speech recog- nition, translation, and language identification,","venue":null,"work_id":"5b26289a-e4f2-41f1-8897-679f17ce6faf","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.598323Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:84bdf42e5bff1221118fce940c18f7eef009fb95d4b0112224fadf8242a95010","observation_id":"3f41bf25-c650-4f98-9b8a-8920bdf1e30a","resolution":{"observed_at":"2026-08-07T10:45:16.440054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:45:15.603784Z","title":"BERT: pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.603784Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e4ec22edaf32eabfbf8d450cd130b70534b6c4904b69fa040b1d1cb5d5cd84d1","observation_id":"19463acd-44b6-48c9-86c0-122a72c50bce","resolution":{"observed_at":"2026-08-07T10:45:15.603784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T10:45:15.616398Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.616398Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:45d19a5950956cb91621bf7e7020990f4926df63e5bfcfd9c240e122e8055ab9","observation_id":"5d8ac709-023a-4726-bbaa-09be72f8e728","resolution":{"observed_at":"2026-08-07T10:45:15.616398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.404360Z","title":"PnG BERT: Augmented BERT on phonemes and graphemes for neural TTS,","venue":null,"work_id":"7f43059b-41bd-4e7e-b333-7e74b3fe7e3e","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.626660Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:998f8884aa8b8001e507640f3b8da86e75d4e576c021b3d8c28a57cb9797e310","observation_id":"17825b3e-71ae-4e4a-a71a-3f083d27a2c4","resolution":{"observed_at":"2026-08-07T10:45:16.411517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.379502Z","title":"Phoneme-level BERT for enhanced prosody of text-to-speech with grapheme pre- dictions,","venue":null,"work_id":"51d6694d-9ee1-49d4-a737-73567f917b43","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.633625Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4737e2d274f6d80d126ecbbcc70b67b7100206adcb9a6c6652538f62fd135c94","observation_id":"4fb61dce-a47f-449a-bdf0-d4cc80b894ab","resolution":{"observed_at":"2026-08-07T10:45:16.385283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.360898Z","title":"Miipher: A robust speech restoration model integrating self-supervised speech and text rep- resentations,","venue":null,"work_id":"94f6db0f-376c-4202-b443-5b2c4ba99aae","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.648375Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:78f764d3d47c33ce4f11223fcad5002ae7800b29219506fac2719bf33fd8b017","observation_id":"2ce861f4-1eea-4496-9484-b587b5dc1434","resolution":{"observed_at":"2026-08-07T10:45:16.366480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.341108Z","title":"Japanese text-to-speech syn- thesis system: Open JTalk,","venue":null,"work_id":"91bc2c6b-a75d-421f-a1ae-ba67bc11c358","year":2010},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.656518Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:182d4d5d622ec618e54cd4bf17d7bdc58aece8d821e070a739f5d257dbdcbded","observation_id":"31d5dd8b-a730-4d18-9463-76b826057f19","resolution":{"observed_at":"2026-08-07T10:45:16.346905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.316797Z","title":"Release of pre-trained mod- els for the Japanese language,","venue":null,"work_id":"c9bdc888-df0c-446d-8f15-caa9bf6e2366","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.665499Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:447e13ad1eb38655ef19f20f01ceefb6a727b2d34d2d52c8ad984c9134035c83","observation_id":"732fba98-843d-4fa3-a9c3-04c6d9d80334","resolution":{"observed_at":"2026-08-07T10:45:16.327855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.299741Z","title":"Joint ctc-attention based end- to-end speech recognition using multi-task learning,","venue":null,"work_id":"2eb590d8-2014-45d8-92f2-f7da7a36980d","year":2017},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.671693Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:1d8c475c597a0e2019d53f8969788adfd8ffa00d655ab3698c16db32cfc111c0","observation_id":"583a47e6-ec4b-4d60-9037-fd4384f561c0","resolution":{"observed_at":"2026-08-07T10:45:16.304977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.278103Z","title":"Relaxing the conditional indepen- dence assumption of ctc-based asr by conditioning on interme- diate predictions,","venue":null,"work_id":"4e3a2acc-5e02-40ef-89f5-053d447ffa74","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.678701Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:93085057dca4636a2a1fae1b531a4f3b94aeceb724858affa022a2e5a366850f","observation_id":"43022c1b-e346-4bc8-8cde-d01027fbcd08","resolution":{"observed_at":"2026-08-07T10:45:16.285924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.250728Z","title":"BERT meets CTC: New formulation of end-to-end speech recognition with pre-trained masked language model,","venue":null,"work_id":"b5169634-8a88-4c3b-b05e-9d799af6de35","year":2022},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.686812Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:87f340c6b11033dad63961860b25cb4ec335374171dd05e1d9a14979d9656ec3","observation_id":"47071f34-7d6e-493e-900b-270466e0f06d","resolution":{"observed_at":"2026-08-07T10:45:16.256179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.229418Z","title":"Improving speech recognition error prediction for modern and off-the-shelf speech recognizers,","venue":null,"work_id":"2eee9dd9-c476-4c72-854e-600077e70158","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.692902Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:400d06a832b3bbfc0aafdf6668b3a4163acf70d9c4722f154bf41c318f4e7884","observation_id":"fc735343-fa35-4e9a-a7d3-262905b81062","resolution":{"observed_at":"2026-08-07T10:45:16.236603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.208311Z","title":"The theory of dynamic programming,","venue":null,"work_id":"7310223b-65a3-4de2-a475-6ba582012d4d","year":1954},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.698387Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:3cbf737cd09ed04bb506ed857f61b5f5c517386f7bd16d6f49eae7da6db19aa5","observation_id":"b26f4c93-ca02-47c9-bb40-7bb3d732ce36","resolution":{"observed_at":"2026-08-07T10:45:16.216220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.190338Z","title":"JSUT and JVS: Free Japanese voice corpora for accelerating speech synthesis re- search,","venue":null,"work_id":"010bdf5f-58d5-40a3-b5a3-abf72ec3db2f","year":2020},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.704647Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:ace52e953b339b7fee197654eef2e3a6eb9ad23b0fd109ea457c3b26df7874ea","observation_id":"cbda27c5-89e2-45a0-8e39-e82525343f51","resolution":{"observed_at":"2026-08-07T10:45:16.195859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.167572Z","title":"Applying conditional random fields to Japanese morphological analysis,","venue":null,"work_id":"fa258283-0452-4e54-9654-220cb06a698e","year":2004},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.711298Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:b91bbfa3e7c02d0aa5546f350e55816fa782043a223cd0f7859a76012780f71c","observation_id":"2059ae9e-9677-44c5-8b28-8d2c822ac4c3","resolution":{"observed_at":"2026-08-07T10:45:16.176497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.145484Z","title":"A proper approach to Japanese morphological analysis: Dictionary, model, and eval- uation","venue":null,"work_id":"2cba477e-d0ed-4aa6-b11a-0800b104738b","year":2008},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.717972Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:db888bf7d91eb3868284436f76edfad319811ecc30f492bf3ea33dd365d2b639","observation_id":"5822a7ae-f875-4f4f-8bca-30cb0505e99b","resolution":{"observed_at":"2026-08-07T10:45:16.151737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.123807Z","title":"Period VITS: Varia- tional inference with explicit pitch modeling for end-to-end emo- tional speech synthesis,","venue":null,"work_id":"6f5b8025-8620-4de6-b341-e4749855f1e9","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.723592Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e5da078916a2e7603a430af45a06236dbe1335da861b5f357682a7c31eb29447","observation_id":"eaa20038-d109-494e-84f1-59dd387d048a","resolution":{"observed_at":"2026-08-07T10:45:16.129554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.105064Z","title":"DEMAND: A col- lection of multi-channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":"6e37598f-a5c7-4c0f-a770-24e9cc90036b","year":2013},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.731270Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:ea037118c6d5e429bbfe654b76229cfc62cc27e0597a7d2d56fc7d832822f936","observation_id":"dd86049e-a605-499f-986c-042b9a825cad","resolution":{"observed_at":"2026-08-07T10:45:16.111311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.082550Z","title":"The ACE challenge—corpus description and performance evaluation,","venue":null,"work_id":"a5656d08-d772-4dee-b09f-23a7a640daac","year":2015},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.740563Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:2419a113763ebe55bcdb9ee27f034363f8c7e317553396b570f3b0379773153f","observation_id":"1a35e2c5-68bb-42df-8bc1-73b3a4f86434","resolution":{"observed_at":"2026-08-07T10:45:16.088377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.063874Z","title":"End-to-end ASR to jointly predict transcriptions and linguistic annotations,","venue":null,"work_id":"bb3cfa4f-179b-47ac-ad34-c896b8f16f1e","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.750147Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:9ce745c0413029a2fb1f5270e8c7d787c6d8a94d224054ebbc4035d22adb3693","observation_id":"296c0a6e-4eca-4d0f-9891-b8969d28c888","resolution":{"observed_at":"2026-08-07T10:45:16.069677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.044607Z","title":"Building competitive direct acoustics-to-word models for english conversa- tional speech recognition,","venue":null,"work_id":"2e60936c-623b-4802-9302-c640b012f988","year":2018},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.760108Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:63c4ecdc693885ae68eee42a0ee1529c34e041ceaacefb8bdcc9fd9de66f550c","observation_id":"2aaf2e9b-4a5f-415d-b22c-84b3264f98ac","resolution":{"observed_at":"2026-08-07T10:45:16.051902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.019900Z","title":"Joint speech recognition and speaker diarization via sequence transduction,","venue":null,"work_id":"f1717bf6-48d5-4ed9-a620-ed1f4f97184c","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.769922Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:006e1ae5fac249be3dc40340ee3192a77335faaa1b4065f1775470b731d2ca4a","observation_id":"f0633d88-a512-411c-8e16-5b87fe41b9e0","resolution":{"observed_at":"2026-08-07T10:45:16.028606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:15.999312Z","title":"Uncon- strained many-to-many alignment for automatic pronunciation an- notation,","venue":null,"work_id":"73502719-395e-4737-aef3-460a1b8da71e","year":2011},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.777135Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:99f6380b62adcb5c3f45a2edc278c546f71571f25ec57c417d90018d7ac11c79","observation_id":"1f62b35d-1388-466c-87de-fbdaad28620a","resolution":{"observed_at":"2026-08-07T10:45:16.004563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:15.972648Z","title":"Evaluation of many-to-many alignment algorithm by auto- matic pronunciation annotation using web text mining,","venue":null,"work_id":"7b51a225-84c7-428d-a633-2367f0b00910","year":2012},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.786786Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:d0db4cceaf2fbc367f44dfa45b9641b874103297b4cabc345c8ee736b295f414","observation_id":"800a57a2-ed89-4474-9bb9-d7ba9a01ac0e","resolution":{"observed_at":"2026-08-07T10:45:15.982204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2506.04527."}