{"as_of":"2026-08-08T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa8e7aff6d59451280c4c52a187fdd73243cba92d41eb48dd1327e972fdfc008","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:56:29.985902Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:56:25.830154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20564","snapshot_observed_at":"2026-08-07T13:56:25.830154Z","title":"Figure 1 illustrates our pipeline for creating the NaijaV oices dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:25.830154Z"},"links":{"cited_paper":"/paper/2505.20564","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:077c6cff1b94b47e8e8bc2859d90573688d99bde4ec2827132b42ea689cc8f76","observation_id":"3d6feb57-e0c6-4767-b7e1-11026b590d00","resolution":{"observed_at":"2026-08-07T13:56:25.830154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"cited_work":{"arxiv_id":"2505.20564","doi":"10.48550/arxiv.2505.20564","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The naijavoices dataset: Cultivating large-scale, high-quality, culturally-rich speech data for african languages","venue":"ArXiv.org","work_id":"656f006a-4768-4773-a43e-2828cafe975f","year":2025},"citing_paper":{"arxiv_id":"2605.01597","last_updated":"2026-05-02T20:11:12Z","snapshot_observed_at":"2026-08-03T00:52:48.762187Z","submitted_at":"2026-05-02T20:11:12Z","title":"Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI","version":1},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-05-08T19:27:18.774649Z"},"links":{"cited_paper":"/paper/2505.20564","citing_paper":"/paper/2605.01597"},"observation_digest":"sha256:48bd70c335f96e88e9ea755a78d3a08700516e744a3cbee2af7522be1c8c83ec","observation_id":"6771a249-08d4-4e15-a0d4-0f90b1c86d08","resolution":{"observed_at":"2026-05-09T05:50:28.342515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"cited_work":{"arxiv_id":"2505.20564","doi":"10.48550/arxiv.2505.20564","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The naijavoices dataset: Cultivating large-scale, high-quality, culturally-rich speech data for african languages","venue":"ArXiv.org","work_id":"656f006a-4768-4773-a43e-2828cafe975f","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":207,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2505.20564","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:fc6e5cc26763d69b6ccf8fccf52a13966d23dcf844c214a8811e5308273d0c07","observation_id":"983a31b4-e4ab-4f69-af0b-3058fad203f5","resolution":{"observed_at":"2026-06-30T22:15:05.629765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20564/citation-record","integrity":"/paper/2505.20564/integrity","json":"/paper/2505.20564/citation-record.json","paper":"/paper/2505.20564"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:37.313376Z","title":"While notable progress has been made in speech processing, African languages – including our focus languages, Igbo, Hausa, and Yoruba – have largely been left behind [ 7, 8]","venue":null,"work_id":"efdb0c62-8cab-4268-93bb-d974f3613b19","year":null},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:25.773223Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:f882e347cfbcae15ee5fd30e074da7d977e366b5a8ee31f9a76d93558fa424ce","observation_id":"11c1482e-737f-49a5-b229-e89af5940eed","resolution":{"observed_at":"2026-08-07T13:56:37.383518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20564","snapshot_observed_at":"2026-08-07T13:56:25.830154Z","title":"Figure 1 illustrates our pipeline for creating the NaijaV oices dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:25.830154Z"},"links":{"cited_paper":"/paper/2505.20564","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:077c6cff1b94b47e8e8bc2859d90573688d99bde4ec2827132b42ea689cc8f76","observation_id":"3d6feb57-e0c6-4767-b7e1-11026b590d00","resolution":{"observed_at":"2026-08-07T13:56:25.830154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:36.968978Z","title":"It features a wide range of speech patterns influenced by age, education levels, accents, and speaking styles – from broken to formal speech, ethnic and dialectal influences","venue":null,"work_id":"abfbb007-ab90-4991-a178-5a491d5fe7be","year":null},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:25.900230Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:d8ae7f632d4acddf0176d2512f152c56e5f274890feda4cb88e2c1c9d75e6ef6","observation_id":"9af524c3-5de4-4e79-9692-67bc1d436ff8","resolution":{"observed_at":"2026-08-07T13:56:37.166709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0243.7847","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:30.767287Z","title":"Concretely, we finetune three selected ASR models on our dataset and evaluate them on both our test set (NV Test) and the FLEURS test set [20]","venue":null,"work_id":"8d10ad95-bd4a-4f5b-b669-6b148bb81c65","year":null},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:25.988475Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:41ee7d467c50c3b5c4b2f7c994bff4986087838940b5899145c71fe134b0eb2e","observation_id":"8ed4b76b-fcba-4576-a741-80f39a82d5fa","resolution":{"observed_at":"2026-08-07T13:56:30.806189Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:36.789630Z","title":"Built on the principles of ‘data farming’, our approach fosters a symbiotic relationship with language communities","venue":null,"work_id":"c3b44a18-dd77-439b-bd77-d5db343f13bd","year":null},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.055703Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:2441644b55a58898a1de3871c9c21fe06d0fb8193b11c2efafd8a2d3102d6f51","observation_id":"203c6a02-ac4b-4ebf-bff6-8e7b517a217f","resolution":{"observed_at":"2026-08-07T13:56:36.866653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:36.613314Z","title":null,"venue":null,"work_id":"cb9a597d-b5c9-4a69-84ec-191aabb6920e","year":null},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.126261Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:5df21609016df4c9160ed2cbe2e26dba4cb57cc6a2a383d11ef53e5521144013","observation_id":"5db42c02-a711-4017-bd61-39da9762e4ee","resolution":{"observed_at":"2026-08-07T13:56:36.719269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:36.418938Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"82ceff08-890b-4cbc-b7cc-2edbe543e2ea","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.179296Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:ab0a1bce9b4d6753c4d6bedff1debc778e50f19ca013cd1fb6bcc119ed1636ba","observation_id":"bb12c951-1bbc-4dd9-9b29-8f898acf4929","resolution":{"observed_at":"2026-08-07T13:56:36.513465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:36.142263Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"7b572387-11f7-4673-95a8-314415485288","year":2024},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.261837Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:1e5c58ff368f005617a2777ac53f00f101aed98dfb83824729449042b4aa6518","observation_id":"f421c7e7-1285-4a25-b393-dc14c5d0898b","resolution":{"observed_at":"2026-08-07T13:56:36.276579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16787","last_updated":"2023-11-04T19:10:06Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:20:26Z","title":"The Data Provenance Initiative: A Large Scale Audit of Dataset Licensing & Attribution in AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16787","snapshot_observed_at":"2026-08-07T13:56:26.333107Z","title":"The data provenance initiative: A large scale audit of dataset licensing & attribution in AI,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.333107Z"},"links":{"cited_paper":"/paper/2310.16787","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:ddc0de969db7ea493f500e11765ab08e0af38d861c868c471002d6668642f2c6","observation_id":"83d1bb78-5b5f-407a-81cd-9c9a17bc186b","resolution":{"observed_at":"2026-08-07T13:56:26.333107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:35.941212Z","title":"IndicVoices: Towards building an inclusive multilingual speech dataset for Indian languages,","venue":null,"work_id":"cf836ac7-c1fb-4c16-aa35-8ef865133120","year":2024},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.416637Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:bf59e187d3f4ce17782ff5377ddb06ee955f33e3880ca38724b89a5870ced4ae","observation_id":"44c787d9-56e3-4010-9eee-db697332afbe","resolution":{"observed_at":"2026-08-07T13:56:36.034575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:35.739535Z","title":"IndicV oices-R: Unlocking a massive multilingual multi- speaker speech corpus for scaling indian TTS,","venue":null,"work_id":"c107cfd0-c9db-446b-84cd-d17929c8df67","year":2024},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.464410Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:e132c4e885b4326e5ccbef2be3bf70d74eebd7e35aa047c46d829ba0a01bff19","observation_id":"e1b1d2cb-26c7-4fae-b3ce-93280571f454","resolution":{"observed_at":"2026-08-07T13:56:35.846060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T13:56:26.515597Z","title":"BASE TTS: Lessons from building a billion-parameter text-to- speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.515597Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:7a6ba3d938ab292bdfd90f7c4d685a103cc87f2d5fefc9037aef5853c197ab7c","observation_id":"89b175f2-8933-40e3-a822-0401697b2d10","resolution":{"observed_at":"2026-08-07T13:56:26.515597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7910/dvn/rxbncz","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:30.280208Z","title":"Replication data for Igbo Natural Language Processing Tasks I,","venue":null,"work_id":"7277291b-94c1-4532-bf6a-59e088662cf4","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.604471Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:9ecf63acb5f015cdaf9c96a8afc5a8b18ac6fb3e189a387b3d717c26e340533f","observation_id":"b8e8a9e4-8227-4f6c-a7af-ae01145eebfa","resolution":{"observed_at":"2026-08-07T13:56:30.348444Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:35.526754Z","title":"Multi- lingual self-supervised speech representations improve the speech recognition of low-resource African languages with codeswitching,","venue":null,"work_id":"f7c4eb63-0849-4073-9704-698de3e3a2cb","year":2023},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.691212Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:b3c47bdf5c4e59a25bf8c5ef41fbeec17c302142c48264050c32bf3efe2ec1ae","observation_id":"bdfb1d8e-de7e-46a0-b35f-567ccf5dbe1a","resolution":{"observed_at":"2026-08-07T13:56:35.621338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11529","last_updated":"2020-03-13T09:01:02Z","snapshot_observed_at":"2026-08-03T19:02:55.352340Z","submitted_at":"2020-03-13T09:01:02Z","title":"Masakhane -- Machine Translation For Africa","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.11529","snapshot_observed_at":"2026-08-07T13:56:26.796632Z","title":"Masakhane - machine translation for Africa,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.796632Z"},"links":{"cited_paper":"/paper/2003.11529","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:6454beed2b70164484f747aaceb75bb01a325724b8ff5ae74e1ac5c298381d28","observation_id":"9830b3b2-4efb-4e9c-95c7-851e53957cb6","resolution":{"observed_at":"2026-08-07T13:56:26.796632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:35.300151Z","title":"Partici- patory research for low-resourced machine translation: A case study in African languages,","venue":null,"work_id":"9ceb26cf-79b3-4741-aea3-d4dfe8c8ff5b","year":2020},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:26.930277Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:2ea2984b94f67231687e43443c1963106d20345ef0e8959851ee1e0195aac674","observation_id":"a4114642-5a1d-424e-89c3-e0f5d75afd6b","resolution":{"observed_at":"2026-08-07T13:56:35.407955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:35.104164Z","title":"The state and fate of linguistic diversity and inclusion in the NLP world,","venue":null,"work_id":"c26ef517-67f9-4c05-b423-93742dec73e7","year":2020},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.058131Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:1ce026480d21dbc715024ca2fc8a07c1eae9f53439d646f9aec12fd4e6639500","observation_id":"4ad9046d-5454-4b94-961f-eb494a51f6a6","resolution":{"observed_at":"2026-08-07T13:56:35.176512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:34.901752Z","title":"A few thousand trans- lations go a long way! Leveraging pre-trained models for African news translation,","venue":null,"work_id":"a4cebe50-67d3-4d70-a9a4-e2fd126d1d9c","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.228195Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:f59d7d924e00289821a8d722640a68e6cc1905ea7d930a03e5c623f0b99e3928","observation_id":"e8546569-57eb-4caa-8ebf-9c30d18b0c80","resolution":{"observed_at":"2026-08-07T13:56:35.026735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:34.654567Z","title":null,"venue":null,"work_id":"f649a297-3486-4793-9588-ec4f4fce1773","year":2020},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.343643Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:7bffb7929fe22b55836584d81e3b4af188d525ae8618049e0eb9d9814995bbcd","observation_id":"cffa84ed-3bc5-4ca7-bc9d-1a9b04888149","resolution":{"observed_at":"2026-08-07T13:56:34.803033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:34.447549Z","title":"GlobalPhone: A multi- lingual text & speech database in 20 languages,","venue":null,"work_id":"bbfd1735-8ed3-4188-a17f-8caf95e04bb2","year":2013},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.466576Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:d24730141490b7197cd8b5cbd7ec49b6ffdb0e90a36b16ac248c4d2628e8f296","observation_id":"f9a5659e-f323-45da-ad3a-76927b2cf504","resolution":{"observed_at":"2026-08-07T13:56:34.531666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:34.231896Z","title":"YFACC: A Yor`ub´a speech–image dataset for cross-lingual keyword localisation through visual grounding,","venue":null,"work_id":"9d310cda-b145-423a-84be-392ce097803e","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.610794Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:75c61a1a08bad7c8fa8b4bf01ba18ff2c0cd725dc77aa67fbd7c6d961648c9c9","observation_id":"99dd0dba-51ca-4205-97d5-99d22f6feba7","resolution":{"observed_at":"2026-08-07T13:56:34.335515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16071","last_updated":"2024-03-27T08:56:01Z","snapshot_observed_at":"2026-07-06T16:00:12.721132Z","submitted_at":"2023-07-29T20:42:50Z","title":"\\`{I}r\\`{o}y\\`{i}nSpeech: A multi-purpose Yor\\`{u}b\\'{a} Speech Corpus","version":2},"cited_work":{"arxiv_id":"2307.16071","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16071","snapshot_observed_at":"2026-08-07T13:56:30.555256Z","title":"\\`{I}r\\`{o}y\\`{i}nSpeech: A multi-purpose Yor\\`{u}b\\'{a} Speech Corpus","venue":"cs.CL","work_id":"f02a84a8-c00c-4b3e-b255-34ecb674230d","year":2023},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.728384Z"},"links":{"cited_paper":"/paper/2307.16071","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:a192fbc42000d7dde5be958269c186352d826e7dc816eed3b77bbd4b76f67c1f","observation_id":"9c46c67d-597e-4272-8e55-8bb5173a78a1","resolution":{"observed_at":"2026-08-07T13:56:30.593979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:34.033323Z","title":"V oices Unheard: NLP resources and models for Yor`ub´a regional dialects,","venue":null,"work_id":"35576404-d2c3-4eef-9f0f-0d41de033424","year":2024},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.834694Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:68f7c4f1c526cb5398c949f3e017af8cc30f9944f8933db1c5b2f4988e3e2673","observation_id":"305af219-7afc-4346-a0dd-8610269909f9","resolution":{"observed_at":"2026-08-07T13:56:34.128670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:33.808573Z","title":"BibleTTS: a large, high-fidelity, multilingual, and uniquely African speech corpus,","venue":null,"work_id":"7275304b-478d-4c44-ae2a-99b170754af8","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:27.942667Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:f7e4e328648eaf16b978701681a9eda3cc3902714b231e6cd6e40d5607b19b31","observation_id":"0a70f040-138c-4672-aea9-90a2801964fa","resolution":{"observed_at":"2026-08-07T13:56:33.929958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:33.606421Z","title":"Common V oice: A massively-multilingual speech corpus,","venue":null,"work_id":"2bb1ab9d-d120-4312-87b9-3fb773c5e0e5","year":2020},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.035532Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:2bf3af18c0c6b9e1671040df4c508df4f9fad2e21e1d0057d3f80c5b16fdc600","observation_id":"3147b531-225a-4bb9-ace9-2a0d06c27f34","resolution":{"observed_at":"2026-08-07T13:56:33.713462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:33.421349Z","title":"FLEURS: Few-shot learning evaluation of universal representations of speech,","venue":null,"work_id":"f7a67b91-319c-4247-9000-a9a6c68d77bd","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.199221Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:6daadf1072d46ffef7825acd3b0546049655d93d258e2381f3911eb4007a146a","observation_id":"a7193215-c851-4cc5-ba8c-f30b9d110db3","resolution":{"observed_at":"2026-08-07T13:56:33.504591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:33.260744Z","title":"Quality at a glance: An audit of web-crawled multilingual datasets,","venue":null,"work_id":"45bab66f-4516-4ade-b236-ebc2d1bea414","year":2021},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.332611Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:68c3eb11c0bd64dfdcbf8bc7d5201cb99605ac25167c670b7cec38e49e66c2c8","observation_id":"cc6f6625-dab4-47ea-9537-5f679ec36301","resolution":{"observed_at":"2026-08-07T13:56:33.338427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:33.064834Z","title":"Separating grains from the chaff: Using data filtering to improve multilingual translation for low-resourced African languages,","venue":null,"work_id":"2b5cb748-7c3d-4116-9591-671cf3169b4f","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.490123Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:16013ac585058034f8e6699d4d9c3158dc9c519c8d0c227921cb181748c24a41","observation_id":"96873929-315a-446b-b9c0-09bbd1e25e6c","resolution":{"observed_at":"2026-08-07T13:56:33.149536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-07T13:56:28.580038Z","title":"The FineWeb Datasets: Decanting the web for the finest text data at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.580038Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:d63b764b312922c13993cf97cdfabf9459bfbfeac2bde26a8646427f4610cea7","observation_id":"8bc08eac-f04b-4a3f-8b00-637b31757013","resolution":{"observed_at":"2026-08-07T13:56:28.580038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:32.900999Z","title":"JW300: A wide-coverage parallel corpus for low-resource languages,","venue":null,"work_id":"e066b79f-9e88-4f19-b89f-b851cb8cd3f3","year":2019},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.668877Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:8f14edc4bdf52ab15eb59684f305ffbdc47599a328817076474ccecbdea04553","observation_id":"acc0dc36-868a-438c-abd2-87d3171859db","resolution":{"observed_at":"2026-08-07T13:56:32.979742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:32.722691Z","title":"`Ir`oy`ınspeech: Yor`ub´a speech corpus,","venue":null,"work_id":"c4258008-ac73-4c72-b31a-ebd572bff757","year":2023},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.747396Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:785aa999e418b1b3ac698f34c0434ff530ad81c0d8a651387dd8aff0fff7a1c1","observation_id":"b7d45a26-68e8-4323-a7b1-ff71d126d160","resolution":{"observed_at":"2026-08-07T13:56:32.809190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.17632/j6kjmfrbby.2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:30.114360Z","title":"Hausa speech corpus,","venue":null,"work_id":"56ee9f68-4c65-4d95-82a2-f5130465e808","year":2021},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.816780Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:35e389f6afbd090df85fb5d2cb870f8920e40bc25ca00d1f6daaded6e21d62e0","observation_id":"26073f54-6068-493c-ac4a-fe7e5f0122ef","resolution":{"observed_at":"2026-08-07T13:56:30.221593Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:32.325779Z","title":"Kencorpus: A Kenyan language corpus of Swahili, Dholuo and Luhya for natural language processing tasks,","venue":null,"work_id":"e9d294fa-0fd7-40f0-92aa-be887b846c0d","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:28.892248Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:db7c082587ac8eaa1bd26e5672e5e41c81e426eff6b9863249548e59ce26eec7","observation_id":"c7af0928-5d8e-4744-88fe-e08c336cb797","resolution":{"observed_at":"2026-08-07T13:56:32.526703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:32.082472Z","title":"LIII. On lines and planes of closest fit to systems of points in space,","venue":null,"work_id":"1f6dec76-cf8a-42aa-bce2-7b26beaf28bf","year":1901},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.019144Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:77e6589ffa35ddb226fff1d22c94c79ef4ba68e0355f68f5fd945e21fb3a188f","observation_id":"2598dc06-a744-406e-8ddd-f238606782fa","resolution":{"observed_at":"2026-08-07T13:56:32.254430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:31.757532Z","title":"Robust signal-to-noise ratio estima- tion based on waveform amplitude distribution analysis,","venue":null,"work_id":"c683fca3-165f-45ad-80cf-d90aedd92166","year":2008},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.122151Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:369895be29db15b0b7a9ede26a49c71783bb2fc0c44d4df12319e7cc47461c67","observation_id":"cd5e4632-baf8-4fb5-b79a-656297daf12e","resolution":{"observed_at":"2026-08-07T13:56:31.952490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:31.541408Z","title":"Audio quality feature,","venue":null,"work_id":"21b97921-7827-44f8-aea9-8fb0ec6dc499","year":2025},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.220939Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:6cafe0c9b2be29a896cd5f036b19f23858604608842b575f632522498f675db8","observation_id":"5cca4861-c392-4c9a-b371-1c33e94ae017","resolution":{"observed_at":"2026-08-07T13:56:31.618588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:31.247842Z","title":"(n.d.) Evaluation","venue":null,"work_id":"e2ef1861-630e-4bc4-b2b1-f51b19f93d76","year":null},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.281822Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:809f302f141d999568161e130532f1cda08a68bf22e0fc101360762391376125","observation_id":"a364f504-22f4-479d-bc69-db6c22758a11","resolution":{"observed_at":"2026-08-07T13:56:31.388331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:31.094343Z","title":"Unsupervised cross-lingual representation learning for speech recognition,","venue":null,"work_id":"3af3996f-6e0a-418f-a7c2-0968709c9f93","year":2021},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.372393Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:00dc4ebda3f9e1415a7349e3363f7ba3bece5e8e4d8354d1eac035f98d85db3c","observation_id":"8f7bbb81-62db-4296-bed6-c80cd69f1d15","resolution":{"observed_at":"2026-08-07T13:56:31.170421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T13:56:29.523320Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.523320Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:f20cb59237c29a94651d5807f1854299e1d2b586d7a9298c73be5d1aeda606f6","observation_id":"6dbcbbbd-4370-4a97-9aba-c82c3a6a2db4","resolution":{"observed_at":"2026-08-07T13:56:29.523320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:30.985154Z","title":"Small Data? No Problem! Ex- ploring the viability of pretrained multilingual language mod- els for low-resourced languages,","venue":null,"work_id":"d71a7bc3-0140-4b8d-9ebc-f8a4cca26305","year":2021},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.620364Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:fec985e1defc1fa9f3d0264efb127b93008c3c55dca3c3593a6d04bb95010b59","observation_id":"b289d64b-ca04-497b-936c-3f7973f29acd","resolution":{"observed_at":"2026-08-07T13:56:31.052468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06409","last_updated":"2022-12-26T13:27:51Z","snapshot_observed_at":"2026-07-06T12:17:56.147137Z","submitted_at":"2021-12-13T03:57:36Z","title":"Data Collection and Quality Challenges in Deep Learning: A Data-Centric AI Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06409","snapshot_observed_at":"2026-08-07T13:56:29.695164Z","title":"Data collection and quality challenges in deep learning: A data-centric ai perspective,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.695164Z"},"links":{"cited_paper":"/paper/2112.06409","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:e650471b7923eea9c20cfc62aaa16bb840a0a76fc1c0f410c54fbdac60a838fb","observation_id":"afc908dd-cfef-403e-8a61-5063e67c5c35","resolution":{"observed_at":"2026-08-07T13:56:29.695164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:30.869133Z","title":"What makes a high-quality training dataset for large language mod- els: A practitioners’ perspective,","venue":null,"work_id":"c0d5d2d4-c7b6-4872-b6e7-43c02cfc1e42","year":2024},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.985902Z"},"links":{"citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:af969009d99797b96f1464418a9d47f9298c77955092ba1843ff88f68288b4cd","observation_id":"1adb9986-0c8f-4d73-b305-abffaafe2324","resolution":{"observed_at":"2026-08-07T13:56:30.929427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06404","last_updated":"2022-03-12T10:50:13Z","snapshot_observed_at":"2026-07-06T12:47:06.223442Z","submitted_at":"2022-03-12T10:50:13Z","title":"A Proposal to Study \"Is High Quality Data All We Need?\"","version":1},"cited_work":{"arxiv_id":"2203.06404","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06404","snapshot_observed_at":"2026-08-07T13:56:30.415786Z","title":"A Proposal to Study \"Is High Quality Data All We Need?\"","venue":"cs.LG","work_id":"f21ad404-52e1-4d5f-b7ab-e4c2a873ee29","year":2022},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.888274Z"},"links":{"cited_paper":"/paper/2203.06404","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:3bb2e742d2b506aa3026b83b29f602e78e65065d8dd4ed2a0fde0a15d246fc67","observation_id":"88dd9e44-4744-41c2-b976-6488a62e9e9c","resolution":{"observed_at":"2026-08-07T13:56:30.468477Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:49:30.149619Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":3,"verified_fuzzy":29},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2505.20564."}