{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:JNGMXH25OWQGR6DEXYGLVD46PF","short_pith_number":"pith:JNGMXH25","schema_version":"1.0","canonical_sha256":"4b4ccb9f5d75a068f864be0cba8f9e797fb452b31549c732e82d46f8522f6137","source":{"kind":"arxiv","id":"2505.14652","version":5},"attestation_state":"computed","paper":{"title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dongfu Jiang, Ge Zhang, Qian Liu, Wenhu Chen, Xueguang Ma, Zejun Ma","submitted_at":"2025-05-20T17:41:33Z","abstract_excerpt":"Reinforcement learning (RL) has recently demonstrated strong potential in enhancing the reasoning capabilities of large language models (LLMs). Particularly, the \"Zero\" reinforcement learning introduced by Deepseek-R1-Zero, enables direct RL training of base LLMs without relying on an intermediate supervised fine-tuning stage. Despite these advancements, current works for LLM reasoning mainly focus on mathematical and coding domains, largely due to data abundance and the ease of answer verification. This limits the applicability and generalization of such models to broader domains, where quest"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.14652","kind":"arxiv","version":5},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-05-20T17:41:33Z","cross_cats_sorted":[],"title_canon_sha256":"ade33b90ea7f42955d17b322962d6134c93347c6c32654bcb992d77cf0b9f8ca","abstract_canon_sha256":"0b053bccb5a53b72403e2e48bc2c4424068ea191e40ea05124955e9e5a797d21"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:18:22.012863Z","signature_b64":"FulqqlNZchgp6rGVOuVBpTyralTEjPgjR1uQb7ceFZD4ZVCLgStbp2t6SKpmBFTGlWcYCPDPKtJG5F/AY6GdAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4b4ccb9f5d75a068f864be0cba8f9e797fb452b31549c732e82d46f8522f6137","last_reissued_at":"2026-07-05T11:18:22.012383Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:18:22.012383Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dongfu Jiang, Ge Zhang, Qian Liu, Wenhu Chen, Xueguang Ma, Zejun Ma","submitted_at":"2025-05-20T17:41:33Z","abstract_excerpt":"Reinforcement learning (RL) has recently demonstrated strong potential in enhancing the reasoning capabilities of large language models (LLMs). Particularly, the \"Zero\" reinforcement learning introduced by Deepseek-R1-Zero, enables direct RL training of base LLMs without relying on an intermediate supervised fine-tuning stage. Despite these advancements, current works for LLM reasoning mainly focus on mathematical and coding domains, largely due to data abundance and the ease of answer verification. This limits the applicability and generalization of such models to broader domains, where quest"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.14652","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.14652/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.14652","created_at":"2026-07-05T11:18:22.012443+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.14652v5","created_at":"2026-07-05T11:18:22.012443+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.14652","created_at":"2026-07-05T11:18:22.012443+00:00"},{"alias_kind":"pith_short_12","alias_value":"JNGMXH25OWQG","created_at":"2026-07-05T11:18:22.012443+00:00"},{"alias_kind":"pith_short_16","alias_value":"JNGMXH25OWQGR6DE","created_at":"2026-07-05T11:18:22.012443+00:00"},{"alias_kind":"pith_short_8","alias_value":"JNGMXH25","created_at":"2026-07-05T11:18:22.012443+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":18,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01612","citing_title":"Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05025","citing_title":"Invariant Gradient Alignment for Robust Reasoning Distillation","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02252","citing_title":"ResMerge: Residual-based Spectral Merging of Large Language Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":180,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14358","citing_title":"Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00609","citing_title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17734","citing_title":"Harnessing LLM Agents with Skill Programs","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2507.14958","citing_title":"MUR: Momentum Uncertainty guided Reasoning for Large Language Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2601.21257","citing_title":"MoCo: A One-Stop Shop for Model Collaboration Research","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04942","citing_title":"TDA-RC: Task-Driven Alignment for Knowledge-Based Reasoning Chains in Large Language Models","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03472","citing_title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2507.17746","citing_title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06241","citing_title":"Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09584","citing_title":"CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics","ref_index":153,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09879","citing_title":"M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06241","citing_title":"Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06882","citing_title":"How Well Do LLMs Perform on the Simplest Long-Chain Reasoning Tasks: An Empirical Study on the Equivalence Class Problem","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17928","citing_title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","ref_index":37,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF","json":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF.json","graph_json":"https://pith.science/api/pith-number/JNGMXH25OWQGR6DEXYGLVD46PF/graph.json","events_json":"https://pith.science/api/pith-number/JNGMXH25OWQGR6DEXYGLVD46PF/events.json","paper":"https://pith.science/paper/JNGMXH25"},"agent_actions":{"view_html":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF","download_json":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF.json","view_paper":"https://pith.science/paper/JNGMXH25","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.14652&json=true","fetch_graph":"https://pith.science/api/pith-number/JNGMXH25OWQGR6DEXYGLVD46PF/graph.json","fetch_events":"https://pith.science/api/pith-number/JNGMXH25OWQGR6DEXYGLVD46PF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF/action/storage_attestation","attest_author":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF/action/author_attestation","sign_citation":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF/action/citation_signature","submit_replication":"https://pith.science/pith/JNGMXH25OWQGR6DEXYGLVD46PF/action/replication_record"}},"created_at":"2026-07-05T11:18:22.012443+00:00","updated_at":"2026-07-05T11:18:22.012443+00:00"}