{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:VMBWP4ND76MCCCTW7DBRCO62A4","short_pith_number":"pith:VMBWP4ND","schema_version":"1.0","canonical_sha256":"ab0367f1a3ff98210a76f8c3113bda070805853117d0778ebaa1389076e1607b","source":{"kind":"arxiv","id":"2404.04167","version":5},"attestation_state":"computed","paper":{"title":"Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Ding Pan, Ge Zhang, Guorui Zhou, Jiaheng Liu, Ruibin Yuan, Songyang Gao, Tianyu Zheng, Wenhu Chen, Xinchen Luo, Xingwei Qu, Xinrun Du, Yuyang Cheng, Zhouliang Yu, Ziyang Ma","submitted_at":"2024-04-05T15:20:02Z","abstract_excerpt":"In this study, we introduce CT-LLM, a 2B large language model (LLM) that illustrates a pivotal shift towards prioritizing the Chinese language in developing LLMs. Uniquely initiated from scratch, CT-LLM diverges from the conventional methodology by primarily incorporating Chinese textual data, utilizing an extensive corpus of 1,200 billion tokens, including 800 billion Chinese tokens, 300 billion English tokens, and 100 billion code tokens. This strategic composition facilitates the model's exceptional proficiency in understanding and processing Chinese, a capability further enhanced through a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.04167","kind":"arxiv","version":5},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2024-04-05T15:20:02Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"1ba0778146cd0d43c9f20314d387e913dd67d2d216ee3cd15149a9cb3dc9e6a7","abstract_canon_sha256":"cf3ec70887bf1bc1810709c487dfdb3c229da48a62b3e56c16c328c1f88dbca6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:06:41.165675Z","signature_b64":"vXVk2hZEN1Q/+Tb9bgRGLl/qG9i9UL9RyMkdL6xqXWJljmxNzCSwjqaza014EgVvhjiyU4nvlw2Ac6gGaN0jCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ab0367f1a3ff98210a76f8c3113bda070805853117d0778ebaa1389076e1607b","last_reissued_at":"2026-07-05T09:06:41.165187Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:06:41.165187Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Ding Pan, Ge Zhang, Guorui Zhou, Jiaheng Liu, Ruibin Yuan, Songyang Gao, Tianyu Zheng, Wenhu Chen, Xinchen Luo, Xingwei Qu, Xinrun Du, Yuyang Cheng, Zhouliang Yu, Ziyang Ma","submitted_at":"2024-04-05T15:20:02Z","abstract_excerpt":"In this study, we introduce CT-LLM, a 2B large language model (LLM) that illustrates a pivotal shift towards prioritizing the Chinese language in developing LLMs. Uniquely initiated from scratch, CT-LLM diverges from the conventional methodology by primarily incorporating Chinese textual data, utilizing an extensive corpus of 1,200 billion tokens, including 800 billion Chinese tokens, 300 billion English tokens, and 100 billion code tokens. This strategic composition facilitates the model's exceptional proficiency in understanding and processing Chinese, a capability further enhanced through a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.04167","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.04167/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.04167","created_at":"2026-07-05T09:06:41.165244+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.04167v5","created_at":"2026-07-05T09:06:41.165244+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.04167","created_at":"2026-07-05T09:06:41.165244+00:00"},{"alias_kind":"pith_short_12","alias_value":"VMBWP4ND76MC","created_at":"2026-07-05T09:06:41.165244+00:00"},{"alias_kind":"pith_short_16","alias_value":"VMBWP4ND76MCCCTW","created_at":"2026-07-05T09:06:41.165244+00:00"},{"alias_kind":"pith_short_8","alias_value":"VMBWP4ND","created_at":"2026-07-05T09:06:41.165244+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07602","citing_title":"Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2503.08223","citing_title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","ref_index":149,"is_internal_anchor":false},{"citing_arxiv_id":"2510.05942","citing_title":"EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2510.25741","citing_title":"Scaling Latent Reasoning via Looped Language Models","ref_index":42,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4","json":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4.json","graph_json":"https://pith.science/api/pith-number/VMBWP4ND76MCCCTW7DBRCO62A4/graph.json","events_json":"https://pith.science/api/pith-number/VMBWP4ND76MCCCTW7DBRCO62A4/events.json","paper":"https://pith.science/paper/VMBWP4ND"},"agent_actions":{"view_html":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4","download_json":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4.json","view_paper":"https://pith.science/paper/VMBWP4ND","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.04167&json=true","fetch_graph":"https://pith.science/api/pith-number/VMBWP4ND76MCCCTW7DBRCO62A4/graph.json","fetch_events":"https://pith.science/api/pith-number/VMBWP4ND76MCCCTW7DBRCO62A4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4/action/storage_attestation","attest_author":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4/action/author_attestation","sign_citation":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4/action/citation_signature","submit_replication":"https://pith.science/pith/VMBWP4ND76MCCCTW7DBRCO62A4/action/replication_record"}},"created_at":"2026-07-05T09:06:41.165244+00:00","updated_at":"2026-07-05T09:06:41.165244+00:00"}