{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:KM6EM2C5WHSI725UV474S3CVDQ","short_pith_number":"pith:KM6EM2C5","schema_version":"1.0","canonical_sha256":"533c46685db1e48febb4af3fc96c551c311987b0089c4edd6f7b9440140b1f4f","source":{"kind":"arxiv","id":"2601.08584","version":1},"attestation_state":"computed","paper":{"title":"Ministral 3","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"Ministral 3 derives 3B, 8B, and 14B dense models through iterative pruning and distillation for constrained hardware.","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Abhinav Rastogi, Adrien Sad\\'e, Alan Jeffares, Albert Jiang, Alexander H. Liu, Alexandre Cahill, Alexandre Gavaudan, Alexandre Sablayrolles, Am\\'elie H\\'eliou, Amos You, Andy Ehrenberg, Andy Lo, Anton Eliseev, Antonia Calvi, Avinash Sooriyarachchi, Baptiste Bout, Baptiste Rozi\\`ere, Baudouin De Monicault, Cl\\'emence Lanfranchi, Corentin Barreau, Cyprien Courtot, Daniele Grattarola, Darius Dabert, Diego de las Casas, Elliot Chane-Sane, Faruk Ahmed, Gabrielle Berrada, Ga\\\"etan Ecrepont, Gauthier Guinet, Georgii Novikov, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Gunshi Gupta, Jan Ludziejewski, Jason Rute, Joachim Studnia, Jonas Amar, Jos\\'ephine Delas, Josselin Somerville Roberts, Karmesh Yadav, Kartik Khandelwal, Khyathi Chandu, Kush Jain, Laurence Aitchison, Laurent Fainsin, L\\'eonard Blier, Lingxiao Zhao, Louis Martin, Lucile Saulnier, Luyu Gao, Maarten Buyl, Margaret Jennings, Marie Pellat, Mark Prins, Mathieu Poir\\'ee, Mathilde Guillaumin, Matthieu Dinot, Matthieu Futeral, Maxime Darrin, Maximilian Augustin, Mia Chiquier, Michel Schimpf, Nathan Grinsztajn, Neha Gupta, Nikhil Raghuraman, Olivier Bousquet, Olivier Duchenne, Patricia Wang, Patrick von Platen, Paula Kurylowicz, Paul Jacob, Paul Wambergue, Pavankumar Reddy Muddireddy, Philom\\`ene Chagniot, Pierre Stock, Pravesh Agrawal, Quentin Torroba, Romain Sauvestre, Roman Soletskyi, Rupert Menneer, Sagar Vaze, Samuel Barry, Sanchit Gandhi, Sandeep Subramanian, Siddhant Waghjale, Siddharth Gandhi, Soham Ghosh, Srijan Mishra, Sumukh Aithal, Szymon Antoniak, Teven Le Scao, Th\\'eo Cachet, Theo Simon Sorg, Thibaut Lavril, Thiziri Nait Saada, Thomas Chabal, Thomas Foubert, Thomas Robert, Thomas Wang, Tim Lawson, Tom Bewley, Tom Edwards, Umar Jamil, Umberto Tomasini, Valeriia Nemychnikova, Van Phung, Victor Jouault, Vincent Maladi\\`ere, Virgile Richard, Wassim Bouaziz, Wen-Ding Li, William Marshall, Xinghui Li, Xinyu Yang, Yassine El Ouahidi, Yihan Wang, Yunhao Tang, Zaccharie Ramzi","submitted_at":"2026-01-13T14:06:03Z","abstract_excerpt":"We introduce the Ministral 3 series, a family of parameter-efficient dense language models designed for compute and memory constrained applications, available in three model sizes: 3B, 8B, and 14B parameters. For each model size, we release three variants: a pretrained base model for general-purpose use, an instruction finetuned, and a reasoning model for complex problem-solving. In addition, we present our recipe to derive the Ministral 3 models through Cascade Distillation, an iterative pruning and continued training with distillation technique. Each model comes with image understanding capa"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":true,"formal_links_present":true},"canonical_record":{"source":{"id":"2601.08584","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2026-01-13T14:06:03Z","cross_cats_sorted":[],"title_canon_sha256":"e55b37022259303e5ae01de25691fecc43df97bbcb774ea08d74f8836badb09f","abstract_canon_sha256":"05566ea0f28de231307f468396cef8930f0398478ba66bab1d812f4188526a69"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-05-17T23:39:22.100791Z","signature_b64":"IpI3WOQu1AKufd/gC1yp36iovo+02BiZT3YNIcVVn5mgOp5AZj9GFswAvwdv1tz70S8lv6vDYw6FKOAJmJGYBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"533c46685db1e48febb4af3fc96c551c311987b0089c4edd6f7b9440140b1f4f","last_reissued_at":"2026-05-17T23:39:22.100132Z","signature_status":"signed_v1","first_computed_at":"2026-05-17T23:39:22.100132Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Ministral 3","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"Ministral 3 derives 3B, 8B, and 14B dense models through iterative pruning and distillation for constrained hardware.","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Abhinav Rastogi, Adrien Sad\\'e, Alan Jeffares, Albert Jiang, Alexander H. Liu, Alexandre Cahill, Alexandre Gavaudan, Alexandre Sablayrolles, Am\\'elie H\\'eliou, Amos You, Andy Ehrenberg, Andy Lo, Anton Eliseev, Antonia Calvi, Avinash Sooriyarachchi, Baptiste Bout, Baptiste Rozi\\`ere, Baudouin De Monicault, Cl\\'emence Lanfranchi, Corentin Barreau, Cyprien Courtot, Daniele Grattarola, Darius Dabert, Diego de las Casas, Elliot Chane-Sane, Faruk Ahmed, Gabrielle Berrada, Ga\\\"etan Ecrepont, Gauthier Guinet, Georgii Novikov, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Gunshi Gupta, Jan Ludziejewski, Jason Rute, Joachim Studnia, Jonas Amar, Jos\\'ephine Delas, Josselin Somerville Roberts, Karmesh Yadav, Kartik Khandelwal, Khyathi Chandu, Kush Jain, Laurence Aitchison, Laurent Fainsin, L\\'eonard Blier, Lingxiao Zhao, Louis Martin, Lucile Saulnier, Luyu Gao, Maarten Buyl, Margaret Jennings, Marie Pellat, Mark Prins, Mathieu Poir\\'ee, Mathilde Guillaumin, Matthieu Dinot, Matthieu Futeral, Maxime Darrin, Maximilian Augustin, Mia Chiquier, Michel Schimpf, Nathan Grinsztajn, Neha Gupta, Nikhil Raghuraman, Olivier Bousquet, Olivier Duchenne, Patricia Wang, Patrick von Platen, Paula Kurylowicz, Paul Jacob, Paul Wambergue, Pavankumar Reddy Muddireddy, Philom\\`ene Chagniot, Pierre Stock, Pravesh Agrawal, Quentin Torroba, Romain Sauvestre, Roman Soletskyi, Rupert Menneer, Sagar Vaze, Samuel Barry, Sanchit Gandhi, Sandeep Subramanian, Siddhant Waghjale, Siddharth Gandhi, Soham Ghosh, Srijan Mishra, Sumukh Aithal, Szymon Antoniak, Teven Le Scao, Th\\'eo Cachet, Theo Simon Sorg, Thibaut Lavril, Thiziri Nait Saada, Thomas Chabal, Thomas Foubert, Thomas Robert, Thomas Wang, Tim Lawson, Tom Bewley, Tom Edwards, Umar Jamil, Umberto Tomasini, Valeriia Nemychnikova, Van Phung, Victor Jouault, Vincent Maladi\\`ere, Virgile Richard, Wassim Bouaziz, Wen-Ding Li, William Marshall, Xinghui Li, Xinyu Yang, Yassine El Ouahidi, Yihan Wang, Yunhao Tang, Zaccharie Ramzi","submitted_at":"2026-01-13T14:06:03Z","abstract_excerpt":"We introduce the Ministral 3 series, a family of parameter-efficient dense language models designed for compute and memory constrained applications, available in three model sizes: 3B, 8B, and 14B parameters. For each model size, we release three variants: a pretrained base model for general-purpose use, an instruction finetuned, and a reasoning model for complex problem-solving. In addition, we present our recipe to derive the Ministral 3 models through Cascade Distillation, an iterative pruning and continued training with distillation technique. Each model comes with image understanding capa"},"claims":{"count":4,"items":[{"kind":"strongest_claim","text":"We introduce the Ministral 3 series, a family of parameter-efficient dense language models designed for compute and memory constrained applications, available in three model sizes: 3B, 8B, and 14B parameters... we present our recipe to derive the Ministral 3 models through Cascade Distillation, an iterative pruning and continued training with distillation technique.","source":"verdict.strongest_claim","status":"machine_extracted","claim_id":"C1","attestation":"unclaimed"},{"kind":"weakest_assumption","text":"That the cascade distillation process produces models that retain high capability in instruction following, reasoning, and image understanding at the stated parameter counts, an assumption with no supporting benchmarks or details in the abstract.","source":"verdict.weakest_assumption","status":"machine_extracted","claim_id":"C2","attestation":"unclaimed"},{"kind":"one_line_summary","text":"Ministral 3 releases 3B/8B/14B parameter-efficient language models with base, instruction, and reasoning variants derived via iterative pruning and distillation, including image understanding capabilities.","source":"verdict.one_line_summary","status":"machine_extracted","claim_id":"C3","attestation":"unclaimed"},{"kind":"headline","text":"Ministral 3 derives 3B, 8B, and 14B dense models through iterative pruning and distillation for constrained hardware.","source":"verdict.pith_extraction.headline","status":"machine_extracted","claim_id":"C4","attestation":"unclaimed"}],"snapshot_sha256":"d3373ca4fd6b6a7f8fddda4dc59a507885b8a73128be1574d6dd97102ead45f8"},"source":{"id":"2601.08584","kind":"arxiv","version":1},"verdict":{"id":"bec9bfc2-31d7-4ec7-9d99-79e5ba1828cf","model_set":{"reader":"grok-4.3"},"created_at":"2026-05-14T19:08:31.206940Z","strongest_claim":"We introduce the Ministral 3 series, a family of parameter-efficient dense language models designed for compute and memory constrained applications, available in three model sizes: 3B, 8B, and 14B parameters... we present our recipe to derive the Ministral 3 models through Cascade Distillation, an iterative pruning and continued training with distillation technique.","one_line_summary":"Ministral 3 releases 3B/8B/14B parameter-efficient language models with base, instruction, and reasoning variants derived via iterative pruning and distillation, including image understanding capabilities.","pipeline_version":"pith-pipeline@v0.9.0","weakest_assumption":"That the cascade distillation process produces models that retain high capability in instruction following, reasoning, and image understanding at the stated parameter counts, an assumption with no supporting benchmarks or details in the abstract.","pith_extraction_headline":"Ministral 3 derives 3B, 8B, and 14B dense models through iterative pruning and distillation for constrained hardware."},"references":{"count":29,"sample":[{"doi":"","year":null,"title":"Pixtral 12b.arXiv preprint arXiv:2410.07073,","work_id":"9ad2b071-82d8-4cfa-b994-b9975094b575","ref_index":1,"cited_arxiv_id":"2410.07073","is_internal_anchor":true},{"doi":"","year":null,"title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","ref_index":2,"cited_arxiv_id":"2305.13245","is_internal_anchor":true},{"doi":"","year":null,"title":"Program Synthesis with Large Language Models","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","ref_index":3,"cited_arxiv_id":"2108.07732","is_internal_anchor":true},{"doi":"","year":null,"title":"Qwen3-VL Technical Report","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","ref_index":4,"cited_arxiv_id":"2511.21631","is_internal_anchor":true},{"doi":"","year":null,"title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","ref_index":5,"cited_arxiv_id":"1803.05457","is_internal_anchor":true}],"resolved_work":29,"snapshot_sha256":"299e2a5273c1187ee3763a8bab7c2ebfc01857d0650b29dc027b61bda77777dc","internal_anchors":18},"formal_canon":{"evidence_count":2,"snapshot_sha256":"c5af5c71a1db1869228b51c4c18cf13f27c0bd944d249ceec137e2d0792a14d5"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2601.08584","created_at":"2026-05-17T23:39:22.100258+00:00"},{"alias_kind":"arxiv_version","alias_value":"2601.08584v1","created_at":"2026-05-17T23:39:22.100258+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2601.08584","created_at":"2026-05-17T23:39:22.100258+00:00"},{"alias_kind":"pith_short_12","alias_value":"KM6EM2C5WHSI","created_at":"2026-05-18T12:33:37.589309+00:00"},{"alias_kind":"pith_short_16","alias_value":"KM6EM2C5WHSI725U","created_at":"2026-05-18T12:33:37.589309+00:00"},{"alias_kind":"pith_short_8","alias_value":"KM6EM2C5","created_at":"2026-05-18T12:33:37.589309+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":96,"internal_anchor_count":96,"sample":[{"citing_arxiv_id":"2607.05722","citing_title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","ref_index":21,"is_internal_anchor":true},{"citing_arxiv_id":"2607.08399","citing_title":"Prompt Compression via Activation Aggregation","ref_index":49,"is_internal_anchor":true},{"citing_arxiv_id":"2607.05992","citing_title":"PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages","ref_index":39,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25935","citing_title":"Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts","ref_index":19,"is_internal_anchor":true},{"citing_arxiv_id":"2606.26960","citing_title":"Toward Agentic SysAdmin: Rethinking System Administration with AI Agents","ref_index":25,"is_internal_anchor":true},{"citing_arxiv_id":"2606.19100","citing_title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2606.19096","citing_title":"PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction","ref_index":13,"is_internal_anchor":true},{"citing_arxiv_id":"2606.18134","citing_title":"Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning","ref_index":46,"is_internal_anchor":true},{"citing_arxiv_id":"2606.15735","citing_title":"EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries","ref_index":23,"is_internal_anchor":true},{"citing_arxiv_id":"2606.13100","citing_title":"LEDGER: A Long-Context Benchmark of Corporate Annual Reports for Grounded Financial Retrieval and Extraction","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2607.02118","citing_title":"Enhancing Fitness Intelligence through Domain-Specific LLM Post-Training","ref_index":39,"is_internal_anchor":true},{"citing_arxiv_id":"2606.12117","citing_title":"Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation","ref_index":28,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10417","citing_title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","ref_index":48,"is_internal_anchor":true},{"citing_arxiv_id":"2606.08938","citing_title":"PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus","ref_index":20,"is_internal_anchor":true},{"citing_arxiv_id":"2606.09380","citing_title":"Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2606.06714","citing_title":"Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception","ref_index":22,"is_internal_anchor":true},{"citing_arxiv_id":"2606.19096","citing_title":"PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction","ref_index":13,"is_internal_anchor":true},{"citing_arxiv_id":"2606.19100","citing_title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2606.08071","citing_title":"SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models","ref_index":77,"is_internal_anchor":true},{"citing_arxiv_id":"2606.07422","citing_title":"The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs","ref_index":55,"is_internal_anchor":true},{"citing_arxiv_id":"2607.00760","citing_title":"MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression","ref_index":37,"is_internal_anchor":true},{"citing_arxiv_id":"2606.06714","citing_title":"Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception","ref_index":18,"is_internal_anchor":true},{"citing_arxiv_id":"2606.06211","citing_title":"FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition","ref_index":24,"is_internal_anchor":true},{"citing_arxiv_id":"2606.05988","citing_title":"Compress-Distill: Reasoning Trace Compression for Efficient Knowledge Distillation","ref_index":22,"is_internal_anchor":true},{"citing_arxiv_id":"2606.04592","citing_title":"Synthetic Personalities: How Well Can LLMs Mimic Individual Respondents Using Socio-Economic Microdata?","ref_index":54,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":2,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ","json":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ.json","graph_json":"https://pith.science/api/pith-number/KM6EM2C5WHSI725UV474S3CVDQ/graph.json","events_json":"https://pith.science/api/pith-number/KM6EM2C5WHSI725UV474S3CVDQ/events.json","paper":"https://pith.science/paper/KM6EM2C5"},"agent_actions":{"view_html":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ","download_json":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ.json","view_paper":"https://pith.science/paper/KM6EM2C5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2601.08584&json=true","fetch_graph":"https://pith.science/api/pith-number/KM6EM2C5WHSI725UV474S3CVDQ/graph.json","fetch_events":"https://pith.science/api/pith-number/KM6EM2C5WHSI725UV474S3CVDQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ/action/storage_attestation","attest_author":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ/action/author_attestation","sign_citation":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ/action/citation_signature","submit_replication":"https://pith.science/pith/KM6EM2C5WHSI725UV474S3CVDQ/action/replication_record"}},"created_at":"2026-05-17T23:39:22.100258+00:00","updated_at":"2026-05-17T23:39:22.100258+00:00"}