{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:EQHMA4IAX5PIDB36A2JHE5FJ4A","short_pith_number":"pith:EQHMA4IA","schema_version":"1.0","canonical_sha256":"240ec07100bf5e81877e06927274a9e031f74022910c6b7c466b103e3ed34a30","source":{"kind":"arxiv","id":"2410.04527","version":1},"attestation_state":"computed","paper":{"title":"Casablanca: Data and Models for Multidialectal Arabic Speech Recognition","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Abdellah El Mekki, Abdelrahman Mohamed, Ahmed Oumar El-Shangiti, Aisha Alraeesi, Amal Makouar, Bashar Talafha, Benelhadj Djelloul Mama Saadia, Chafei Mohamed Chafei, El Moatez Billah Nagoudi, Fakhraddin Alwajih, Hamzah A. Alsayadi, Hiba Zayed, Hour Mohamed, Ismail Berrada, Karima Kadaoui, Mariem Habiboullah, Mohamedou cheikh tourad, Muhammad Abdul-Mageed, Mustafa Jarrar, Rahaf Alhamouri, Rwaa Assi, Samar Mohamed Magdy, Sara Shatnawi, Shady Shehata, Walid Al-Dhabyani, Yasir Ech-Chammakhy, Yousra Berrachedi","submitted_at":"2024-10-06T15:41:38Z","abstract_excerpt":"In spite of the recent progress in speech processing, the majority of world languages and dialects remain uncovered. This situation only furthers an already wide technological divide, thereby hindering technological and socioeconomic inclusion. This challenge is largely due to the absence of datasets that can empower diverse speech systems. In this paper, we seek to mitigate this obstacle for a number of Arabic dialects by presenting Casablanca, a large-scale community-driven effort to collect and transcribe a multi-dialectal Arabic dataset. The dataset covers eight dialects: Algerian, Egyptia"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.04527","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-10-06T15:41:38Z","cross_cats_sorted":[],"title_canon_sha256":"0953c444ed7fa92ae69ae93d7d8d8877610a3542b91b8ca56c59e60504724d05","abstract_canon_sha256":"5414823344517ff7d452ea6a7ddd8e2b3b3b073b6f9e6aac82b89c214910ec16"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:16:35.572725Z","signature_b64":"CihKuEKWJeM9ll+wsin/v7aeCqc7A22xZ6iJFJ/lXpmzdQ5lcKfBB9tnWBhT93o9ZDV6mME/bfNVC47kcU16Cg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"240ec07100bf5e81877e06927274a9e031f74022910c6b7c466b103e3ed34a30","last_reissued_at":"2026-07-05T09:16:35.572205Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:16:35.572205Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Casablanca: Data and Models for Multidialectal Arabic Speech Recognition","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Abdellah El Mekki, Abdelrahman Mohamed, Ahmed Oumar El-Shangiti, Aisha Alraeesi, Amal Makouar, Bashar Talafha, Benelhadj Djelloul Mama Saadia, Chafei Mohamed Chafei, El Moatez Billah Nagoudi, Fakhraddin Alwajih, Hamzah A. Alsayadi, Hiba Zayed, Hour Mohamed, Ismail Berrada, Karima Kadaoui, Mariem Habiboullah, Mohamedou cheikh tourad, Muhammad Abdul-Mageed, Mustafa Jarrar, Rahaf Alhamouri, Rwaa Assi, Samar Mohamed Magdy, Sara Shatnawi, Shady Shehata, Walid Al-Dhabyani, Yasir Ech-Chammakhy, Yousra Berrachedi","submitted_at":"2024-10-06T15:41:38Z","abstract_excerpt":"In spite of the recent progress in speech processing, the majority of world languages and dialects remain uncovered. This situation only furthers an already wide technological divide, thereby hindering technological and socioeconomic inclusion. This challenge is largely due to the absence of datasets that can empower diverse speech systems. In this paper, we seek to mitigate this obstacle for a number of Arabic dialects by presenting Casablanca, a large-scale community-driven effort to collect and transcribe a multi-dialectal Arabic dataset. The dataset covers eight dialects: Algerian, Egyptia"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.04527","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.04527/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.04527","created_at":"2026-07-05T09:16:35.572269+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.04527v1","created_at":"2026-07-05T09:16:35.572269+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.04527","created_at":"2026-07-05T09:16:35.572269+00:00"},{"alias_kind":"pith_short_12","alias_value":"EQHMA4IAX5PI","created_at":"2026-07-05T09:16:35.572269+00:00"},{"alias_kind":"pith_short_16","alias_value":"EQHMA4IAX5PIDB36","created_at":"2026-07-05T09:16:35.572269+00:00"},{"alias_kind":"pith_short_8","alias_value":"EQHMA4IA","created_at":"2026-07-05T09:16:35.572269+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2509.02038","citing_title":"NADI 2025: The First Multidialectal Arabic Speech Processing Shared Task","ref_index":85,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A","json":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A.json","graph_json":"https://pith.science/api/pith-number/EQHMA4IAX5PIDB36A2JHE5FJ4A/graph.json","events_json":"https://pith.science/api/pith-number/EQHMA4IAX5PIDB36A2JHE5FJ4A/events.json","paper":"https://pith.science/paper/EQHMA4IA"},"agent_actions":{"view_html":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A","download_json":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A.json","view_paper":"https://pith.science/paper/EQHMA4IA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.04527&json=true","fetch_graph":"https://pith.science/api/pith-number/EQHMA4IAX5PIDB36A2JHE5FJ4A/graph.json","fetch_events":"https://pith.science/api/pith-number/EQHMA4IAX5PIDB36A2JHE5FJ4A/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A/action/storage_attestation","attest_author":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A/action/author_attestation","sign_citation":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A/action/citation_signature","submit_replication":"https://pith.science/pith/EQHMA4IAX5PIDB36A2JHE5FJ4A/action/replication_record"}},"created_at":"2026-07-05T09:16:35.572269+00:00","updated_at":"2026-07-05T09:16:35.572269+00:00"}