{"as_of":"2026-08-07T07:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2afc2ec2359a7c674c71de3c7117f7b7722d258855d8a49da7d4c21262ffef99","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:37:34.629191Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19049/citation-record","integrity":"/paper/2607.19049/integrity","json":"/paper/2607.19049/citation-record.json","paper":"/paper/2607.19049"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:29.832680Z","title":"Speech recognition by machines and humans,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:29.832680Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:81f0b926bb6c9d22a73a40880bb758f456d650cfd5e2bf427a94ac1fee8804d1","observation_id":"9c5686d6-688f-4aab-b6d8-1bbc94fa0106","resolution":{"observed_at":"2026-08-01T13:37:29.832680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:29.903489Z","title":"The Interspeech 2008 Consonant Challenge","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:29.903489Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:94628bde4dfa1c7c55e96498702774108400b89860384b80e4bd62831041aaa4","observation_id":"5c87d0bd-6c70-4c11-9368-6910a9bf7186","resolution":{"observed_at":"2026-08-01T13:37:29.903489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:30.048093Z","title":"Robustness of spectro-temporal features against intrinsic and extrinsic variations in automatic speech recogni- tion,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:30.048093Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:1fa23f454b01c51d65652a31e3b330622afda11a715e95d507a9634a1ff09a7d","observation_id":"8eaa9f22-d390-437a-a88c-60cdb22e8efd","resolution":{"observed_at":"2026-08-01T13:37:30.048093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:30.201357Z","title":"What’s the difference? Comparing humans and machines on the aurora2 speech recognition task,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:30.201357Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:feac1ab10d25fa678d48d2a85161315abf3a1bd1ac100f250a777c0d468e0f1f","observation_id":"672307c0-45e3-4291-b9f6-c878645147f6","resolution":{"observed_at":"2026-08-01T13:37:30.201357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:30.384384Z","title":"Comparing human and automatic speech recognition in simple and complex acoustic scenes,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:30.384384Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:9a9be2cbdd03b2f7fba8c8410494d07d8d1c046fecf8d2d8e4442b97e379f7b8","observation_id":"d793bbe3-3f5a-43d8-9e67-cd6f9f99d52f","resolution":{"observed_at":"2026-08-01T13:37:30.384384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:30.557660Z","title":"A comparison of automatic and human speech recognition in null grammar,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:30.557660Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:f8eda1dc00f35d288663e041a8fb288f9310a2c0af2a5f42643810fb09f56779","observation_id":"d632286c-1196-4aed-a0bc-d91fe614fe4a","resolution":{"observed_at":"2026-08-01T13:37:30.557660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:30.710030Z","title":"Toward human parity in conversational speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:30.710030Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:7564920619c468da789f06a8b66725e9c575e42e439724b595aeb7d2c6982553","observation_id":"c56576f5-f553-43cf-bb44-8c1074417881","resolution":{"observed_at":"2026-08-01T13:37:30.710030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:30.829935Z","title":"Transcription methods for consistency, volume and efficiency,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:30.829935Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:385fd4970c352a69f6add83640cf149b45546fa49b74f9da7a3894881a9a5171","observation_id":"bd70f199-180f-4dfd-a92e-8326b3e850e8","resolution":{"observed_at":"2026-08-01T13:37:30.829935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:30.948251Z","title":"Speech recognition in adverse conditions by humans and machines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:30.948251Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:ab49184773dcb544ed0b1dcdce2348eb118867d3d9e73f2217e945e24d0ddc37","observation_id":"79a00090-29c0-4fab-bd87-3696ce865ffd","resolution":{"observed_at":"2026-08-01T13:37:30.948251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.095544Z","title":"Wav2Vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.095544Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:8f5fd052022669aca08aacbed116e825092a65edc996b680e93cbabe8a68b617","observation_id":"573568fa-1b6d-4f16-96b5-fea4fb2134d0","resolution":{"observed_at":"2026-08-01T13:37:31.095544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.178777Z","title":"Whisper-large-v3,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.178777Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:398a3620b22b699066fcdf4246066e6eb68c6cc59233adbde26673da9418c9b1","observation_id":"1c12f942-c373-418b-9b14-d8fa9435f605","resolution":{"observed_at":"2026-08-01T13:37:31.178777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.277430Z","title":"Evaluation of automatic speech recognition for conversational speech in Dutch, English and German: What goes missing?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.277430Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:3fa2f9826bb35e2c860fee4c60f4fb1d9124e18de5ed0f1470b1e0d9cd124a2f","observation_id":"1b5e1f72-06db-4030-97ba-e794615dcd11","resolution":{"observed_at":"2026-08-01T13:37:31.277430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.435393Z","title":"Revisiting parity of human vs. machine conversational speech tran- scription,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.435393Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:1b49e6b693ab939de6a817d3ed097b8436b896188853064fbaf8d645a67bfce0","observation_id":"f20a360f-ad95-4009-b06e-8e1d306199bd","resolution":{"observed_at":"2026-08-01T13:37:31.435393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.528212Z","title":"Bidirec- tional LSTM-RNN for improving automated assessment of non-native children’s speech,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.528212Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:2cc4dc94ae289b96f54fccc6b26d6ac0ed820ee3c698c9bef1195aa90f66c255","observation_id":"9579693e-ab8c-45b8-852c-55c82a519284","resolution":{"observed_at":"2026-08-01T13:37:31.528212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.570811Z","title":"Towards inclusive automatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.570811Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:69564e5198f33e44ff6908a2ae0cee2e4f9fc92df7e8882287828d1175a9fcb7","observation_id":"959283c4-3989-4ea9-aa91-4e087bdccf14","resolution":{"observed_at":"2026-08-01T13:37:31.570811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.618117Z","title":"Bias in Flemish automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.618117Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:30777ed1dd7d3ecaddd6657d0ee050c57a26aa103dd0f6089ed07467ea0b1d38","observation_id":"038575dc-4292-47a1-bd4e-bfc696f43467","resolution":{"observed_at":"2026-08-01T13:37:31.618117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.702808Z","title":"End-to-end neural systems for automatic children speech recognition: An empirical study,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.702808Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:1b23a2f6d64386e0c2aec5f7b8532df23521ffd47109c30f930b7f2504948809","observation_id":"ca5f6db1-d6f1-47c9-b2b5-fe99752bf9b5","resolution":{"observed_at":"2026-08-01T13:37:31.702808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.760263Z","title":"Automatic recognition of Dutch dysarthric speech, a pilot study,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.760263Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:11fd720aa74c1435d6a0a446574639304563da27f1a673708a53f899c389bf14","observation_id":"29f062b5-a1b5-48fd-be0a-e49bf22bcbda","resolution":{"observed_at":"2026-08-01T13:37:31.760263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.842699Z","title":"Phonetic analysis of dysarthric speech tempo and applications to robust personalised dysarthric speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.842699Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:b7746b13befba42f7cb61425238f85343866cba346ab453d26bf34c8ce5f5bc5","observation_id":"2c724fda-7baa-454d-93d7-0abb721ae46e","resolution":{"observed_at":"2026-08-01T13:37:31.842699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.914121Z","title":"Recent progress in the CUHK dysarthric speech recognition system,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.914121Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:beda6daf7a483ae98061361e6c8c41b69ab45630f21db233941075570aef40d9","observation_id":"8aa0a7dc-2a15-41fb-963e-1e065afeede0","resolution":{"observed_at":"2026-08-01T13:37:31.914121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:31.994284Z","title":"Cross-lingual self-supervised speech repre- sentations for improved dysarthric speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:31.994284Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:03214a64213c2d026a533225886e44b8cce01d9da471f8507766a38322494e4b","observation_id":"7dc2ec46-1ab4-47b1-9584-5b6e02765fd7","resolution":{"observed_at":"2026-08-01T13:37:31.994284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:32.106108Z","title":"Zero-shot recognition of dysarthric speech using commercial automatic speech recognition and multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:32.106108Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:ab696094a347ab6628b91ec289acbb05fcdf952c8164ab5fe61b16c385bafdac","observation_id":"29470931-97ac-49fe-87de-52d1dd254531","resolution":{"observed_at":"2026-08-01T13:37:32.106108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:32.249809Z","title":"On the impact of dysarthric speech on contemporary ASR cloud platforms,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:32.249809Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:5cbc1e1c8941754a97f6f7c13b1b77635fedb5bcbcb4a1c07f0ecd99888eda7d","observation_id":"1f00ebc7-86d6-4800-b413-420a605cf8f6","resolution":{"observed_at":"2026-08-01T13:37:32.249809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:32.392803Z","title":"Low-resource automatic speech recognition and error analyses of oral cancer speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:32.392803Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:38cba3014167f158a5346b02eee8f2f53b7368794c0feb641fde41421301b802","observation_id":"51299ff0-a94b-4097-9316-ae72d9e99eac","resolution":{"observed_at":"2026-08-01T13:37:32.392803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:32.550049Z","title":"Evaluation of speech intelligibility for children with cleft lip and palate by means of automatic speech recognition,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:32.550049Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:5ea5db483f4dae2e4a5734725034ce90401db4917415df3006b34bf762354aac","observation_id":"907a5afe-aa63-4645-a4e9-da0937df0c7e","resolution":{"observed_at":"2026-08-01T13:37:32.550049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:32.666005Z","title":"See what I’m saying? Comparing intelligent personal assistant use for native and non-native language speakers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:32.666005Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:22e7a0ee9cc6a0bda54d0363052314e5e26973edef51e916b6a8d9c528917768","observation_id":"8b21e41d-b353-4ed2-802d-0327dc99774c","resolution":{"observed_at":"2026-08-01T13:37:32.666005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:32.753388Z","title":"Do you understand the words that are comin outta my mouth? V oice assistant comprehension of medication names,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:32.753388Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:052967344d06730e0eadeeac08aa04ae7fba3bdf9c93b4463d1b99df0f51c56e","observation_id":"e4902d85-4fdf-4e20-8e98-9e5d8e50347d","resolution":{"observed_at":"2026-08-01T13:37:32.753388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:32.933500Z","title":"Mit- igating bias against non-native accents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:32.933500Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:c83705c9ad90abcc0598bb90e7d201597220c180a3e8c1f0a7ffdee32d95e500","observation_id":"f0d092bd-4c38-4b52-9bd7-ef723f52601b","resolution":{"observed_at":"2026-08-01T13:37:32.933500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.033171Z","title":"Racial disparities in automated speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.033171Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:55cbc4786ef14493093dd0781a2657a9e676190d5cccef74bba97b97b517b210","observation_id":"28ae22ae-682a-4d9e-adfe-d61b5309208c","resolution":{"observed_at":"2026-08-01T13:37:33.033171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.175811Z","title":"Gender and dialect bias in YouTube’s automatic captions,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.175811Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:50de800789eee14c988824c5444de2a25f8c270b2e4f51102cf60088886dc22e","observation_id":"facea80c-7139-4e61-871d-6c0e1ec75df9","resolution":{"observed_at":"2026-08-01T13:37:33.175811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.339998Z","title":"Effects of talker dialect, gender & race on accuracy of Bing speech and YouTube automatic captions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.339998Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:949e327b3c037fdb60b20909db7e3cdcb115e54d7869ceec3c137eff0673b787","observation_id":"2294e1e4-099b-4490-abec-b860a60fb55d","resolution":{"observed_at":"2026-08-01T13:37:33.339998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.435369Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.435369Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:bb3c5a0639fc4af4ca2c24da2acf6cb9b593b204b6b9c9dedd9182d7fa615dae","observation_id":"7d91ec88-498b-4038-b4ea-ac485cdd4f21","resolution":{"observed_at":"2026-08-01T13:37:33.435369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.524789Z","title":"Speech-to-text: Transcription models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.524789Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:d638c885fad32772840be82c530ec92b68d4cffb100fd215eb9091f399134fc0","observation_id":"9919af95-60fb-47c1-930a-e0984827abeb","resolution":{"observed_at":"2026-08-01T13:37:33.524789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.641818Z","title":"JASMIN- CGN: Extension of the Spoken Dutch Corpus with speech of elderly people, children and non-natives in the human-machine interaction modality,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.641818Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:80b49e6caf976b3122a77d9669eb26942d92e01e30b369707f6876511a6c4aff","observation_id":"c2dfef7a-c8c5-45c9-b8f1-79d3669d044c","resolution":{"observed_at":"2026-08-01T13:37:33.641818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.814389Z","title":"FFmpeg loudnorm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.814389Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:e295ef8090f12d54ae98d537ed8d5e0db82bb1d68b30c5d5516f9be63e4364bb","observation_id":"1128d4f2-c216-489c-89ac-06c6d20e674d","resolution":{"observed_at":"2026-08-01T13:37:33.814389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:33.974630Z","title":"Lexical information drives perceptual learning of distorted speech: evidence from the comprehension of noise-vocoded sentences","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:33.974630Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:90c153cbc9a18e9c5b38ac9a8c1df3bd5dae34f061b3bdb3768038595387a8f6","observation_id":"bbe1c9f6-24ca-447f-b907-b707cf3bc75d","resolution":{"observed_at":"2026-08-01T13:37:33.974630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1515/phon-2025-0061","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speech recognition performance disparities between Dutch diverse speaker groups","venue":"Phonetica","work_id":"934fbb9a-e788-4ad2-b98f-31cd7b73af68","year":2026},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.057070Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:3827692cdc7033a6dd4fce9147d980079386009bba65d613aa8c0b427b202c6f","observation_id":"3222a60e-122d-46b9-8839-1613a59bdf86","resolution":{"observed_at":"2026-08-01T13:38:23.925193Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:34.184696Z","title":"Un- supervised cross-lingual representation learning for speech recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.184696Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:c3b28c03ae6aae2db99713a019dd91d4159fdb3006089264f007d13cacf8321a","observation_id":"d65377b8-b8da-46ac-9264-096bb207c46c","resolution":{"observed_at":"2026-08-01T13:37:34.184696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:34.246441Z","title":"The Spoken Dutch Corpus. Overview and first evalua- tion,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.246441Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:ce14b9b5452e4a491bd9af1bb79bb03a4cd368117c725d62ac939fac7d9f99f5","observation_id":"dcc67260-5108-4c09-a649-e8bf55263122","resolution":{"observed_at":"2026-08-01T13:37:34.246441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:34.328177Z","title":"Bootstrap estimates for confidence intervals in ASR performance evaluation,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.328177Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:89a7ab14bfaeac8624c2da5e60998727530f957af50db11cb29b568cf6f69535","observation_id":"530efd52-c0d1-4f68-bd78-8f78590cb3c3","resolution":{"observed_at":"2026-08-01T13:37:34.328177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03700","last_updated":"2024-12-04T20:30:16Z","snapshot_observed_at":"2026-07-06T20:01:50.356653Z","submitted_at":"2024-12-04T20:30:16Z","title":"Good practices for evaluation of machine learning systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03700","snapshot_observed_at":"2026-08-01T13:37:34.417441Z","title":"Good practices for eval- uation of machine learning systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.417441Z"},"links":{"cited_paper":"/paper/2412.03700","citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:dce086216f996b9b81b96cf8c85a9ad7864907efa94a5ec7f0a3b5440ee759ae","observation_id":"7434e100-2f37-452f-a909-1c95257413d8","resolution":{"observed_at":"2026-08-01T13:37:34.417441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:34.492190Z","title":"Emmeans: Estimated marginal means, aka least-squares means","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.492190Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:7281b03f6eb05a2438099952a564d1e35d9497ad85b067102dc4c1478dbb7157","observation_id":"f8f1e2e7-5137-4d66-8373-81b452661b2a","resolution":{"observed_at":"2026-08-01T13:37:34.492190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:34.573940Z","title":"Ageing voices: The effect of changes in voice parameters on ASR Performance,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.573940Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:0cc9b7e039d698a9fab05b34c0f31b7d57407b043b990c2d74361336c0f4a073","observation_id":"0033d073-2190-46d6-83b5-c4ee0cc0e4c4","resolution":{"observed_at":"2026-08-01T13:37:34.573940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:37:34.629191Z","title":"Uncovering bias in asr systems: Evaluating Wav2vec2 and Whisper for dutch speakers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T13:37:34.629191Z"},"links":{"citing_paper":"/paper/2607.19049"},"observation_digest":"sha256:82c58031bd079016eb178d5c79a83afc8b6c9f1a94e28446adc06fe2e7d2ce13","observation_id":"c56f1bdc-368e-48a5-9d8e-3eac034b5fce","resolution":{"observed_at":"2026-08-01T13:37:34.629191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19049","last_updated":"2026-07-21T12:37:41Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T13:37:29.501457Z","submitted_at":"2026-07-21T12:37:41Z","title":"Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2607.19049."}