{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3b93f3106e9a065b4df03caecd6c53721e8680c8de4035c8d049d262726fcd9","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:33:53.920089Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:33:50.951862Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:33:54.309530Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"cited_work":{"arxiv_id":"2506.07646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07646","snapshot_observed_at":"2026-08-07T05:33:54.309530Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","venue":"cs.CL","work_id":"c8dfe6f6-03c6-4ecd-9305-0fb024302b40","year":2025},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.951862Z"},"links":{"cited_paper":"/paper/2506.07646","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:aa6e02778c13efd6f5461fe8f235604433431757cf910c7b841be62da5ba6d8f","observation_id":"00e469c6-d85e-457b-8842-2a142c8aa630","resolution":{"observed_at":"2026-08-07T05:33:54.429992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07646/citation-record","integrity":"/paper/2506.07646/integrity","json":"/paper/2506.07646/citation-record.json","paper":"/paper/2506.07646"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.930807Z","title":null,"venue":null,"work_id":"a2457361-f0a4-4323-887a-8adabc6e3fee","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.665721Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:5420e444c7aec328dbce4e8bebc35c8f5209376c2d54580ec385e803fef76ade","observation_id":"253b81c9-f476-4391-b006-ed4cf90f5099","resolution":{"observed_at":"2026-08-07T05:33:55.935572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"cited_work":{"arxiv_id":"2506.07646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07646","snapshot_observed_at":"2026-08-07T05:33:54.309530Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","venue":"cs.CL","work_id":"c8dfe6f6-03c6-4ecd-9305-0fb024302b40","year":2025},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.951862Z"},"links":{"cited_paper":"/paper/2506.07646","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:aa6e02778c13efd6f5461fe8f235604433431757cf910c7b841be62da5ba6d8f","observation_id":"00e469c6-d85e-457b-8842-2a142c8aa630","resolution":{"observed_at":"2026-08-07T05:33:54.429992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.899440Z","title":"#”. For each accent phrase, we divide it into graphemes and TTS labels using the delimiter “|","venue":null,"work_id":"c587abba-16a6-4524-881c-f335f2b37146","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.079231Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:e9877876b5355af2fe4940f1d36062cc29e454c3dceda0ca9b7bcdcc5d258b72","observation_id":"91318715-bb77-4e99-b88e-79028646b3a3","resolution":{"observed_at":"2026-08-07T05:33:55.904062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.883886Z","title":"ブィ ” and “ビ","venue":null,"work_id":"3cdce73e-20aa-4d0b-ab08-2d6c4225e93e","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.150189Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:9d4f379e51ce95b1bc66792b9e4728a15a35740bd77da574277144c72bee177f","observation_id":"63f3318d-2eeb-4add-bb3c-dd0d4fbbe38b","resolution":{"observed_at":"2026-08-07T05:33:55.888413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.868845Z","title":"To address the phonemic labeling issue associated with Kanji characters, we adopt a decoding strategy that incorporates dic- tionary prior knowledge","venue":null,"work_id":"f90bc56b-33a4-44f7-bb70-44c61d2bfe6a","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.305047Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:155c919f5158a416cc113ffe322bdec4776f159c9bbf81bda73640dce00aefbf","observation_id":"87001ae8-3a89-4560-8df0-9357527be1b2","resolution":{"observed_at":"2026-08-07T05:33:55.873672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.821899Z","title":"A unified front-end framework for english text-to-speech syn- thesis,","venue":null,"work_id":"48b62c2f-c17c-49b5-a6d1-c479eb56447d","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.012099Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:f381801e1dae965f96719d9acaeedb8b0472dbe863be15ebd484cf2431106f90","observation_id":"53b808c4-7044-48ae-b726-aa238163ed11","resolution":{"observed_at":"2026-08-07T05:33:55.826823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-07T05:33:51.376309Z","title":"E2 tts: Embarrass- ingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.376309Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:945a0686ac2d7e58b1d59d5e9ada1d761e77879b0a45f461c577c320e9998615","observation_id":"76430cf7-6798-4e45-8f26-f2dd8121b684","resolution":{"observed_at":"2026-08-07T05:33:51.376309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T05:33:51.501351Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.501351Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:b60afdec7f248be3504faf0d2bb77e2e57bc8e5c253f7ceae80690db61dad0f7","observation_id":"18ec3f15-32de-44f4-b89d-3f97b8fafb02","resolution":{"observed_at":"2026-08-07T05:33:51.501351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T05:33:51.609621Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.609621Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:c63f8ea4ff954cef152bee0d8df920e3dd6d73aaaf8631f4b8ad4ce8a3e952c8","observation_id":"47f8a2ca-2413-402c-a719-cf2fe2236001","resolution":{"observed_at":"2026-08-07T05:33:51.609621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.853663Z","title":"Impacts of input linguistic feature representation on japanese end-to-end speech synthesis,","venue":null,"work_id":"9b6ce750-c0c0-4367-b0bb-ff377ecd115e","year":2019},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.773644Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:b115d55a53cfb6841f12bbe50f1ccd57a55f27206c936ba0b4efe922f69aef98","observation_id":"43a7426a-5dad-4650-b1bc-20c9987a7f33","resolution":{"observed_at":"2026-08-07T05:33:55.858321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.914185Z","title":"However, these methods either only focus on prosody annotation or rely on complicated pipelines","venue":null,"work_id":"3b32e0b4-0de9-4c19-8b5e-17fa9adbb992","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.787955Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:23b91dfc01aa7b1b7178087da0998e90bab141a6b23c20808214ea11e4746f66","observation_id":"438178da-5627-4800-a118-739148fca03a","resolution":{"observed_at":"2026-08-07T05:33:55.920447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.837378Z","title":"Prosodic features con- trol by symbols as input of sequence-to-sequence acoustic mod- eling for neural tts,","venue":null,"work_id":"aaebef28-8c65-4682-bfdd-8655c1bbc9ec","year":2021},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.860333Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:fa402a2dc000ca9e71ee3a387a0bdd7939f5206f2c1972116ff1e8dbf9fd98d7","observation_id":"8996299f-79b6-4f74-9010-1b9ae9acf37d","resolution":{"observed_at":"2026-08-07T05:33:55.842192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15404","last_updated":"2020-12-31T02:34:57Z","snapshot_observed_at":"2026-07-06T10:28:54.011729Z","submitted_at":"2020-12-31T02:34:57Z","title":"Unified Mandarin TTS Front-end Based on Distilled BERT Model","version":1},"cited_work":{"arxiv_id":"2012.15404","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.15404","snapshot_observed_at":"2026-08-07T05:33:54.077724Z","title":"Unified Mandarin TTS Front-end Based on Distilled BERT Model","venue":"cs.SD","work_id":"c9b2deb4-0971-4d0f-93f2-3697f14c3935","year":2020},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.158651Z"},"links":{"cited_paper":"/paper/2012.15404","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:d012fc6913993265a7697a4ae04431e4073d2b7c2a72ef7480461d650bcbd17a","observation_id":"c45148ba-cc31-46e1-856a-3b8fe0aaa918","resolution":{"observed_at":"2026-08-07T05:33:54.148718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.804948Z","title":"A unified accent esti- mation method based on multi-task learning for japanese text-to- speech,","venue":null,"work_id":"5ede56cb-0ed9-4674-a82d-d5c5cc1a2fc2","year":2022},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.271932Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:49157ec5a431ee649aee89bcc4ac32dac1dd029c7235f374388a5d81b14d672b","observation_id":"2c70ab7f-6038-41df-857c-cc1e8240032b","resolution":{"observed_at":"2026-08-07T05:33:55.810439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.784992Z","title":"End-to-end asr to jointly predict transcriptions and linguistic annotations,","venue":null,"work_id":"82126846-4ef9-4f4d-a964-21a1fafa9b52","year":2021},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.423236Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:0a359d578223152a654a646d70697321c7b9582e7218297f130ab29499aa3518","observation_id":"6ad4b55a-7782-415b-a446-d0522e5e5863","resolution":{"observed_at":"2026-08-07T05:33:55.789595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.769270Z","title":"Audio- conditioned phonemic and prosodic annotation for building text- to-speech models from unlabeled speech data,","venue":null,"work_id":"f394f5e5-84cc-493b-87a0-f8230b2055f0","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.580553Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:fefa2d427aedb89909c1a1e45a9fabfc01e5ea9b78665ab24e845c1a80674ac2","observation_id":"f8e3027f-d9ef-43ec-8bcd-d5f057c689de","resolution":{"observed_at":"2026-08-07T05:33:55.773913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.753570Z","title":"Automatic prosody annotation with pre-trained text- speech model,","venue":null,"work_id":"1723ae5f-52c2-4bfc-9943-9717ef87f86c","year":2022},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.644857Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:01edcd3468eb9063b630b7ac8184c26a878a9bd095b1705adb6b223ce81768b3","observation_id":"bdc8a950-e117-4484-9467-848140de031a","resolution":{"observed_at":"2026-08-07T05:33:55.757896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.737798Z","title":"G2pa: G2p with aligned audio for mandarin chinese,","venue":null,"work_id":"83dc6ca4-b0e0-49f1-a54f-3306910f6de2","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.791420Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:b6ea068c336861becff4462f18de89bd4ee0ebdea47247e413b1037cb4d368ea","observation_id":"baab77ce-9c1e-4174-ab31-64838d04a974","resolution":{"observed_at":"2026-08-07T05:33:55.742904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:52.884523Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.884523Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:97683d15b268a701ab30ec403948985f50671a80cf0e077803840192dc7ea339","observation_id":"477f577b-d313-459d-96ab-a70ded181cc7","resolution":{"observed_at":"2026-08-07T05:33:52.884523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:53.032764Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.032764Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:92552c5bb2e27834bab20e4a9b733c42bb54a0eca3d608998edb3a34ef514f92","observation_id":"0b7841fa-cec0-4104-b24d-fb822222db2a","resolution":{"observed_at":"2026-08-07T05:33:53.032764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:53.186970Z","title":"Zero-shot domain-sensitive speech recognition with prompt- conditioning fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.186970Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:323b430fe26baa25f6ab19ad90ebe4570dc429ae3263caddf8ee4967ec464103","observation_id":"dd6e10cc-7013-4121-9300-c5939c1ff6bb","resolution":{"observed_at":"2026-08-07T05:33:53.186970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.634454Z","title":"Prompt tuning for speech recognition on unknown spoken name entities,","venue":null,"work_id":"17a36829-49bc-4ac3-906d-b56972727114","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.263260Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:54254d6eb754e9c9bfbbaade1fc47617ae0bdc40eb37a0aa27fdb575b6ec2ba9","observation_id":"40855888-ffb2-4ddb-a055-da5ee2067c56","resolution":{"observed_at":"2026-08-07T05:33:55.682039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.407919Z","title":"Extending whisper with prompt tuning to target-speaker asr,","venue":null,"work_id":"0c8ece5c-70b1-4fbf-bc42-dd34394dfa31","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.339967Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:d613f2775fc6ccae6a0430b0c60ea40e2f4b045e63cde022126e9da400f14269","observation_id":"ae99b0b4-7761-4ff9-aea2-0db55d4b7418","resolution":{"observed_at":"2026-08-07T05:33:55.526591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.172882Z","title":"Perceiver-prompt: Flexible speaker adaptation in whisper for chinese disordered speech recognition,","venue":null,"work_id":"e31e42ea-7936-4f8e-bc8e-6f5b87084763","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.388327Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:d470886c2802b1a838272b6b621a2b5b8df8d075dc2e5e2018b4137ec527a68e","observation_id":"c330a1a8-3056-4d41-9b4c-cca0e7c68aa3","resolution":{"observed_at":"2026-08-07T05:33:55.281778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:54.929808Z","title":"Applying conditional random fields to japanese morphological analysis,","venue":null,"work_id":"7fd77acc-3fe1-49da-a6e9-19805cbbafed","year":2004},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.454542Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:d860f3cff68bd81ca9ac22c9963009de41ffe4ec1632330068e43981c302ad53","observation_id":"712e21e5-a28a-429e-bfd1-d6ab197e3da3","resolution":{"observed_at":"2026-08-07T05:33:55.025620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:54.679778Z","title":"A proper approach to japanese morphological analysis: Dictionary, model, and eval- uation","venue":null,"work_id":"4bd32b56-3e3f-485f-8721-b94314eaab31","year":2008},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.563402Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:3371e0cd550198a8bd9daed9f0363216ce934c6289176abf5dc6683786132a86","observation_id":"d758b06d-870d-4a4e-bd7e-c93fb762fde8","resolution":{"observed_at":"2026-08-07T05:33:54.789301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-08-07T12:14:00.547338Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-08-07T05:33:53.645210Z","title":"Jsut corpus: free large-scale japanese speech corpus for end-to-end speech synthe- sis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.645210Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:92e887c6f62428d7ee52e2074bd57ec83ed8ebc932f717c1a79b5e29bd7b2d30","observation_id":"b87c52ac-3c7c-42f0-b555-bede0aadabf0","resolution":{"observed_at":"2026-08-07T05:33:53.645210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:33:53.733085Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.733085Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:aacdde4086952c73fbc9a0cecd81d1f53a51af62476613ad2e89414029f959b1","observation_id":"f22a6537-8921-4163-b814-8d3cd93b2ad9","resolution":{"observed_at":"2026-08-07T05:33:53.733085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06248","last_updated":"2019-08-17T06:04:46Z","snapshot_observed_at":"2026-08-04T18:00:26.763973Z","submitted_at":"2019-08-17T06:04:46Z","title":"JVS corpus: free Japanese multi-speaker voice corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06248","snapshot_observed_at":"2026-08-07T05:33:53.799236Z","title":"Jvs corpus: free japanese multi-speaker voice cor- pus,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.799236Z"},"links":{"cited_paper":"/paper/1908.06248","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:c1be3acd14e10a8513d4a20d8e5d338a599f0ac513eed5a10617053575a49501","observation_id":"66ba85f3-dd33-48a6-a3a2-306299ae381d","resolution":{"observed_at":"2026-08-07T05:33:53.799236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:54.524771Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"611a0889-9e69-414b-a743-f894bfbacf5f","year":2020},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.849183Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:caf9435daa21de7acc45dfc5a94088e6a846dc8f8f8a691507f6aeca7dccb064","observation_id":"f6e6ce3c-1240-4e25-b3ea-bdf2c7fbe2dd","resolution":{"observed_at":"2026-08-07T05:33:54.580616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:53.920089Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.920089Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:d1af876825cbdd076e08a02f62a380a31e1ca58868fe7f904d97f10f8ddfdbc0","observation_id":"96ed9fe9-0f09-466c-bbc4-47643c0ea502","resolution":{"observed_at":"2026-08-07T05:33:53.920089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:13:05.085606Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2506.07646."}