{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:S6PMGG4WZOIYTKRWNCPDAABMIB","short_pith_number":"pith:S6PMGG4W","schema_version":"1.0","canonical_sha256":"979ec31b96cb9189aa36689e30002c4041402f39ebd99d3ba604fd55d26992ff","source":{"kind":"arxiv","id":"2505.07291","version":1},"attestation_state":"computed","paper":{"title":"INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Aaron Pazdera, Fares Obeid, Felix Gabriel, Jack Min Ong, Jannik Straube, Johannes Hagemann, Justus Mattern, Kemal Erdem, Kushal Thaman, Manveer Basra, Matthew Di Ferrante, Michael Keiblinger, Prime Intellect Team, Sami Jaghouar","submitted_at":"2025-05-12T07:24:33Z","abstract_excerpt":"We introduce INTELLECT-2, the first globally distributed reinforcement learning (RL) training run of a 32 billion parameter language model. Unlike traditional centralized training efforts, INTELLECT-2 trains a reasoning model using fully asynchronous RL across a dynamic, heterogeneous swarm of permissionless compute contributors.\n  To enable a training run with this unique infrastructure, we built various components from scratch: we introduce PRIME-RL, our training framework purpose-built for distributed asynchronous reinforcement learning, based on top of novel components such as TOPLOC, whic"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.07291","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-12T07:24:33Z","cross_cats_sorted":["cs.DC"],"title_canon_sha256":"3165ca6cfe441745938bfc7d8f52de1353e7ed79d9fe9a0cf3a921aabd8d06cf","abstract_canon_sha256":"ae62b37c00022c6d53fe36b15441272c2161c67e280c5683125dacd300f16111"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:01:45.635554Z","signature_b64":"OojrA5irBWgc0wAUlA4vCxN0fLxLo4Rv+8V/4Lfe7+nIbKT5hyzVH9sVbp32ZbEUzJA4sfM3YlX0wo+EiNiaDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"979ec31b96cb9189aa36689e30002c4041402f39ebd99d3ba604fd55d26992ff","last_reissued_at":"2026-07-05T11:01:45.634988Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:01:45.634988Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Aaron Pazdera, Fares Obeid, Felix Gabriel, Jack Min Ong, Jannik Straube, Johannes Hagemann, Justus Mattern, Kemal Erdem, Kushal Thaman, Manveer Basra, Matthew Di Ferrante, Michael Keiblinger, Prime Intellect Team, Sami Jaghouar","submitted_at":"2025-05-12T07:24:33Z","abstract_excerpt":"We introduce INTELLECT-2, the first globally distributed reinforcement learning (RL) training run of a 32 billion parameter language model. Unlike traditional centralized training efforts, INTELLECT-2 trains a reasoning model using fully asynchronous RL across a dynamic, heterogeneous swarm of permissionless compute contributors.\n  To enable a training run with this unique infrastructure, we built various components from scratch: we introduce PRIME-RL, our training framework purpose-built for distributed asynchronous reinforcement learning, based on top of novel components such as TOPLOC, whic"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.07291","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.07291/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.07291","created_at":"2026-07-05T11:01:45.635054+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.07291v1","created_at":"2026-07-05T11:01:45.635054+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.07291","created_at":"2026-07-05T11:01:45.635054+00:00"},{"alias_kind":"pith_short_12","alias_value":"S6PMGG4WZOIY","created_at":"2026-07-05T11:01:45.635054+00:00"},{"alias_kind":"pith_short_16","alias_value":"S6PMGG4WZOIYTKRW","created_at":"2026-07-05T11:01:45.635054+00:00"},{"alias_kind":"pith_short_8","alias_value":"S6PMGG4W","created_at":"2026-07-05T11:01:45.635054+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2602.03452","citing_title":"Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2505.24298","citing_title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02964","citing_title":"Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12160","citing_title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB","json":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB.json","graph_json":"https://pith.science/api/pith-number/S6PMGG4WZOIYTKRWNCPDAABMIB/graph.json","events_json":"https://pith.science/api/pith-number/S6PMGG4WZOIYTKRWNCPDAABMIB/events.json","paper":"https://pith.science/paper/S6PMGG4W"},"agent_actions":{"view_html":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB","download_json":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB.json","view_paper":"https://pith.science/paper/S6PMGG4W","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.07291&json=true","fetch_graph":"https://pith.science/api/pith-number/S6PMGG4WZOIYTKRWNCPDAABMIB/graph.json","fetch_events":"https://pith.science/api/pith-number/S6PMGG4WZOIYTKRWNCPDAABMIB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB/action/storage_attestation","attest_author":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB/action/author_attestation","sign_citation":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB/action/citation_signature","submit_replication":"https://pith.science/pith/S6PMGG4WZOIYTKRWNCPDAABMIB/action/replication_record"}},"created_at":"2026-07-05T11:01:45.635054+00:00","updated_at":"2026-07-05T11:01:45.635054+00:00"}