{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:77G2FJQYRV3DUXMP7ET2WYLEWH","short_pith_number":"pith:77G2FJQY","schema_version":"1.0","canonical_sha256":"ffcda2a6188d763a5d8ff927ab6164b1f29d2ca89312a3ea935d69d949ca1023","source":{"kind":"arxiv","id":"2505.22660","version":4},"attestation_state":"computed","paper":{"title":"Maximizing Confidence Alone Improves Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Alex Ippoliti, Deepak Pathak, Hao Liu, Katerina Fragkiadaki, Lili Chen, Mihir Prabhudesai","submitted_at":"2025-05-28T17:59:37Z","abstract_excerpt":"Reinforcement learning (RL) has enabled machine learning models to achieve significant advances in many fields. Most recently, RL has empowered frontier language models to solve challenging math, science, and coding problems. However, central to any RL algorithm is the reward function, and reward engineering is a notoriously difficult problem in any domain. In this paper, we propose RENT: Reinforcement Learning via Entropy Minimization -- a fully unsupervised RL method that requires no external reward or ground-truth answers, and instead uses the model's entropy of its underlying distribution "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.22660","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-05-28T17:59:37Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"eb9ed5e636670862faae819e272a7adf2cb1e123c9b6c1477eee363daf8f04d9","abstract_canon_sha256":"a2a0fa73d4e3a0fbd833fc59feae5fada2c0a254d03040241c7b32ff5e723487"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:28:16.922191Z","signature_b64":"60QdsJe1RcAcRJi/3+zPtgHhL3RrbPTcoSy+wHGkSpd1G0sXkisl/WhD7MDdIh2ILUVg4wUao+tiN6DSaACaCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ffcda2a6188d763a5d8ff927ab6164b1f29d2ca89312a3ea935d69d949ca1023","last_reissued_at":"2026-07-05T11:28:16.921551Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:28:16.921551Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Maximizing Confidence Alone Improves Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Alex Ippoliti, Deepak Pathak, Hao Liu, Katerina Fragkiadaki, Lili Chen, Mihir Prabhudesai","submitted_at":"2025-05-28T17:59:37Z","abstract_excerpt":"Reinforcement learning (RL) has enabled machine learning models to achieve significant advances in many fields. Most recently, RL has empowered frontier language models to solve challenging math, science, and coding problems. However, central to any RL algorithm is the reward function, and reward engineering is a notoriously difficult problem in any domain. In this paper, we propose RENT: Reinforcement Learning via Entropy Minimization -- a fully unsupervised RL method that requires no external reward or ground-truth answers, and instead uses the model's entropy of its underlying distribution "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.22660","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.22660/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.22660","created_at":"2026-07-05T11:28:16.921619+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.22660v4","created_at":"2026-07-05T11:28:16.921619+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.22660","created_at":"2026-07-05T11:28:16.921619+00:00"},{"alias_kind":"pith_short_12","alias_value":"77G2FJQYRV3D","created_at":"2026-07-05T11:28:16.921619+00:00"},{"alias_kind":"pith_short_16","alias_value":"77G2FJQYRV3DUXMP","created_at":"2026-07-05T11:28:16.921619+00:00"},{"alias_kind":"pith_short_8","alias_value":"77G2FJQY","created_at":"2026-07-05T11:28:16.921619+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.20881","citing_title":"When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04516","citing_title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01464","citing_title":"Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":72,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21125","citing_title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25864","citing_title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2602.12579","citing_title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2510.07962","citing_title":"LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21125","citing_title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17037","citing_title":"D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2509.14234","citing_title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2506.10947","citing_title":"Spurious Rewards: Rethinking Training Signals in RLVR","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2603.19880","citing_title":"What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11775","citing_title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11775","citing_title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08516","citing_title":"OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06642","citing_title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04542","citing_title":"Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01428","citing_title":"Hallucinations Undermine Trust; Metacognition is a Way Forward","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21327","citing_title":"Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04065","citing_title":"Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07244","citing_title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07864","citing_title":"ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18493","citing_title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","ref_index":13,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH","json":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH.json","graph_json":"https://pith.science/api/pith-number/77G2FJQYRV3DUXMP7ET2WYLEWH/graph.json","events_json":"https://pith.science/api/pith-number/77G2FJQYRV3DUXMP7ET2WYLEWH/events.json","paper":"https://pith.science/paper/77G2FJQY"},"agent_actions":{"view_html":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH","download_json":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH.json","view_paper":"https://pith.science/paper/77G2FJQY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.22660&json=true","fetch_graph":"https://pith.science/api/pith-number/77G2FJQYRV3DUXMP7ET2WYLEWH/graph.json","fetch_events":"https://pith.science/api/pith-number/77G2FJQYRV3DUXMP7ET2WYLEWH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH/action/storage_attestation","attest_author":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH/action/author_attestation","sign_citation":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH/action/citation_signature","submit_replication":"https://pith.science/pith/77G2FJQYRV3DUXMP7ET2WYLEWH/action/replication_record"}},"created_at":"2026-07-05T11:28:16.921619+00:00","updated_at":"2026-07-05T11:28:16.921619+00:00"}