{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:7ND2ZD5OPYPMQYW3P3YTAN4JQG","short_pith_number":"pith:7ND2ZD5O","schema_version":"1.0","canonical_sha256":"fb47ac8fae7e1ec862db7ef130378981807dcf840a66083577fb0e765215233f","source":{"kind":"arxiv","id":"2504.08672","version":1},"attestation_state":"computed","paper":{"title":"Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Chang Ma, Fangzhi Xu, Haiteng Zhao, Hang Yan, Jun Liu, Junxian He, Kanzhi Cheng, Qiushi Sun, Zhiyong Wu","submitted_at":"2025-04-11T16:26:23Z","abstract_excerpt":"Advancing LLM reasoning skills has captivated wide interest. However, current post-training techniques rely heavily on supervisory signals, such as outcome supervision or auxiliary reward models, which face the problem of scalability and high annotation costs. This motivates us to enhance LLM reasoning without the need for external supervision. We introduce a generalizable and purely unsupervised self-training framework, named Genius. Without external auxiliary, Genius requires to seek the optimal response sequence in a stepwise manner and optimize the LLM. To explore the potential steps and e"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.08672","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-04-11T16:26:23Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"d29df97b181fe862d46861b9dc677114a26fdc3a08eb4e72f81cc1ffcfa22c5e","abstract_canon_sha256":"00eb642155fcaff6cd7c98321ad79f5c183ac20491ffc00027023b9c631e110e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:47:52.649201Z","signature_b64":"qdF2b2AsRnloSxyWF9bDvvE93wwRtF/pidN7ojrNHBOwINInd6NoL+maiIK9WNYG+nL3q9pGHkmGJfOJMkYyDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fb47ac8fae7e1ec862db7ef130378981807dcf840a66083577fb0e765215233f","last_reissued_at":"2026-07-05T10:47:52.648689Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:47:52.648689Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Chang Ma, Fangzhi Xu, Haiteng Zhao, Hang Yan, Jun Liu, Junxian He, Kanzhi Cheng, Qiushi Sun, Zhiyong Wu","submitted_at":"2025-04-11T16:26:23Z","abstract_excerpt":"Advancing LLM reasoning skills has captivated wide interest. However, current post-training techniques rely heavily on supervisory signals, such as outcome supervision or auxiliary reward models, which face the problem of scalability and high annotation costs. This motivates us to enhance LLM reasoning without the need for external supervision. We introduce a generalizable and purely unsupervised self-training framework, named Genius. Without external auxiliary, Genius requires to seek the optimal response sequence in a stepwise manner and optimize the LLM. To explore the potential steps and e"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.08672","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.08672/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.08672","created_at":"2026-07-05T10:47:52.648762+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.08672v1","created_at":"2026-07-05T10:47:52.648762+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.08672","created_at":"2026-07-05T10:47:52.648762+00:00"},{"alias_kind":"pith_short_12","alias_value":"7ND2ZD5OPYPM","created_at":"2026-07-05T10:47:52.648762+00:00"},{"alias_kind":"pith_short_16","alias_value":"7ND2ZD5OPYPMQYW3","created_at":"2026-07-05T10:47:52.648762+00:00"},{"alias_kind":"pith_short_8","alias_value":"7ND2ZD5O","created_at":"2026-07-05T10:47:52.648762+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":84,"is_internal_anchor":false},{"citing_arxiv_id":"2506.13351","citing_title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2603.00918","citing_title":"Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards","ref_index":77,"is_internal_anchor":false},{"citing_arxiv_id":"2502.17419","citing_title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","ref_index":204,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG","json":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG.json","graph_json":"https://pith.science/api/pith-number/7ND2ZD5OPYPMQYW3P3YTAN4JQG/graph.json","events_json":"https://pith.science/api/pith-number/7ND2ZD5OPYPMQYW3P3YTAN4JQG/events.json","paper":"https://pith.science/paper/7ND2ZD5O"},"agent_actions":{"view_html":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG","download_json":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG.json","view_paper":"https://pith.science/paper/7ND2ZD5O","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.08672&json=true","fetch_graph":"https://pith.science/api/pith-number/7ND2ZD5OPYPMQYW3P3YTAN4JQG/graph.json","fetch_events":"https://pith.science/api/pith-number/7ND2ZD5OPYPMQYW3P3YTAN4JQG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG/action/storage_attestation","attest_author":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG/action/author_attestation","sign_citation":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG/action/citation_signature","submit_replication":"https://pith.science/pith/7ND2ZD5OPYPMQYW3P3YTAN4JQG/action/replication_record"}},"created_at":"2026-07-05T10:47:52.648762+00:00","updated_at":"2026-07-05T10:47:52.648762+00:00"}