{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:SSZSTQB6NI3LIBPWBGPD2N4CWE","short_pith_number":"pith:SSZSTQB6","schema_version":"1.0","canonical_sha256":"94b329c03e6a36b405f6099e3d3782b13cdd81cb3b6517cfbb4cd26128d336ab","source":{"kind":"arxiv","id":"2504.06011","version":1},"attestation_state":"computed","paper":{"title":"Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Aaryamonvikram Singh, Ali El Filali, Alok Anil Jadhav, Avraham Sheinin, Awantika Shukla, Debopriyo Banerjee, Dhruv Sahnan, Fajri Koto, Gokul Ramakrishnan, Gurpreet Gosal, Haonan Li, Junaid Bhat, Lalit Pradhan, Monojit Choudhury, Mukund Choudhary, Natalia Vassilieva, Neha Sengupta, Onkar Pandit, Parvez Mullah, Preslav Nakov, Rahul Pal, Rituraj Joshi, Rocktim Jyoti Das, Samta Kamboj, Samujjwal Ghosh, Shivam Chauhan, Soundar Doraiswamy, Sunil Sahu, Utkarsh Agarwal, Xudong Han","submitted_at":"2025-04-08T13:16:54Z","abstract_excerpt":"Developing high-quality large language models (LLMs) for moderately resourced languages presents unique challenges in data availability, model adaptation, and evaluation. We introduce Llama-3-Nanda-10B-Chat, or Nanda for short, a state-of-the-art Hindi-centric instruction-tuned generative LLM, designed to push the boundaries of open-source Hindi language models. Built upon Llama-3-8B, Nanda incorporates continuous pre-training with expanded transformer blocks, leveraging the Llama Pro methodology. A key challenge was the limited availability of high-quality Hindi text data; we addressed this t"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.06011","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-04-08T13:16:54Z","cross_cats_sorted":[],"title_canon_sha256":"61295e8b24c61d968b728f8f505945cc26ae9635335bc2824bfebec175433c2e","abstract_canon_sha256":"f1f0dee8249ba722c955159fc0a2a093287d59910ed4dadadc73727bf57a456e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:46:13.890322Z","signature_b64":"Q3hdYQM8alPVSlFoWAoRKqWdXF6DVvrZSRD7Q0Isbbtl/yz0EC97Q6ItfZmUez/NhZRCn+JD2zEY0aT/8O+IAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"94b329c03e6a36b405f6099e3d3782b13cdd81cb3b6517cfbb4cd26128d336ab","last_reissued_at":"2026-07-05T10:46:13.889747Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:46:13.889747Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Aaryamonvikram Singh, Ali El Filali, Alok Anil Jadhav, Avraham Sheinin, Awantika Shukla, Debopriyo Banerjee, Dhruv Sahnan, Fajri Koto, Gokul Ramakrishnan, Gurpreet Gosal, Haonan Li, Junaid Bhat, Lalit Pradhan, Monojit Choudhury, Mukund Choudhary, Natalia Vassilieva, Neha Sengupta, Onkar Pandit, Parvez Mullah, Preslav Nakov, Rahul Pal, Rituraj Joshi, Rocktim Jyoti Das, Samta Kamboj, Samujjwal Ghosh, Shivam Chauhan, Soundar Doraiswamy, Sunil Sahu, Utkarsh Agarwal, Xudong Han","submitted_at":"2025-04-08T13:16:54Z","abstract_excerpt":"Developing high-quality large language models (LLMs) for moderately resourced languages presents unique challenges in data availability, model adaptation, and evaluation. We introduce Llama-3-Nanda-10B-Chat, or Nanda for short, a state-of-the-art Hindi-centric instruction-tuned generative LLM, designed to push the boundaries of open-source Hindi language models. Built upon Llama-3-8B, Nanda incorporates continuous pre-training with expanded transformer blocks, leveraging the Llama Pro methodology. A key challenge was the limited availability of high-quality Hindi text data; we addressed this t"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.06011","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.06011/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.06011","created_at":"2026-07-05T10:46:13.889811+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.06011v1","created_at":"2026-07-05T10:46:13.889811+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.06011","created_at":"2026-07-05T10:46:13.889811+00:00"},{"alias_kind":"pith_short_12","alias_value":"SSZSTQB6NI3L","created_at":"2026-07-05T10:46:13.889811+00:00"},{"alias_kind":"pith_short_16","alias_value":"SSZSTQB6NI3LIBPW","created_at":"2026-07-05T10:46:13.889811+00:00"},{"alias_kind":"pith_short_8","alias_value":"SSZSTQB6","created_at":"2026-07-05T10:46:13.889811+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE","json":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE.json","graph_json":"https://pith.science/api/pith-number/SSZSTQB6NI3LIBPWBGPD2N4CWE/graph.json","events_json":"https://pith.science/api/pith-number/SSZSTQB6NI3LIBPWBGPD2N4CWE/events.json","paper":"https://pith.science/paper/SSZSTQB6"},"agent_actions":{"view_html":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE","download_json":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE.json","view_paper":"https://pith.science/paper/SSZSTQB6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.06011&json=true","fetch_graph":"https://pith.science/api/pith-number/SSZSTQB6NI3LIBPWBGPD2N4CWE/graph.json","fetch_events":"https://pith.science/api/pith-number/SSZSTQB6NI3LIBPWBGPD2N4CWE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE/action/storage_attestation","attest_author":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE/action/author_attestation","sign_citation":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE/action/citation_signature","submit_replication":"https://pith.science/pith/SSZSTQB6NI3LIBPWBGPD2N4CWE/action/replication_record"}},"created_at":"2026-07-05T10:46:13.889811+00:00","updated_at":"2026-07-05T10:46:13.889811+00:00"}