{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:GDCMPX54JXAFCBOXGN5G2U5GN5","short_pith_number":"pith:GDCMPX54","schema_version":"1.0","canonical_sha256":"30c4c7dfbc4dc05105d7337a6d53a66f48f82122fa9800981e67f0496b496f4a","source":{"kind":"arxiv","id":"2502.19655","version":1},"attestation_state":"computed","paper":{"title":"Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Guanghui Qin, Hoifung Poon, Qianchu Liu, Sheng Zhang, Tristan Naumann","submitted_at":"2025-02-27T00:54:38Z","abstract_excerpt":"Reinforcement learning from verifiable rewards (RLVR) has recently gained attention for its ability to elicit self-evolved reasoning capabilitie from base language models without explicit reasoning supervisions, as demonstrated by DeepSeek-R1. While prior work on RLVR has primarily focused on mathematical and coding domains, its applicability to other tasks and domains remains unexplored. In this work, we investigate whether medical reasoning can emerge from RLVR. We introduce Med-RLVR as an initial study of RLVR in the medical domain leveraging medical multiple-choice question answering (MCQA"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.19655","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-02-27T00:54:38Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"26ccdea64e19da85492620b13f5971e623f63a0d10c01eefcd2a1b8ad7122a45","abstract_canon_sha256":"6743cf809e0d9b8510c2b207d4dc52b22fd2195554b6c32efc812e9838dcd51b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:20:50.454838Z","signature_b64":"FoVQTDvtgPYvrcwbLTyAcXYSaCySFO3vRXYwfovwYyU8ZLxPkPFCfAKPqZiXDuDlLIaKwn5u6yzdFQR4WY8aDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"30c4c7dfbc4dc05105d7337a6d53a66f48f82122fa9800981e67f0496b496f4a","last_reissued_at":"2026-07-05T10:20:50.454346Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:20:50.454346Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Guanghui Qin, Hoifung Poon, Qianchu Liu, Sheng Zhang, Tristan Naumann","submitted_at":"2025-02-27T00:54:38Z","abstract_excerpt":"Reinforcement learning from verifiable rewards (RLVR) has recently gained attention for its ability to elicit self-evolved reasoning capabilitie from base language models without explicit reasoning supervisions, as demonstrated by DeepSeek-R1. While prior work on RLVR has primarily focused on mathematical and coding domains, its applicability to other tasks and domains remains unexplored. In this work, we investigate whether medical reasoning can emerge from RLVR. We introduce Med-RLVR as an initial study of RLVR in the medical domain leveraging medical multiple-choice question answering (MCQA"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.19655","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.19655/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.19655","created_at":"2026-07-05T10:20:50.454408+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.19655v1","created_at":"2026-07-05T10:20:50.454408+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.19655","created_at":"2026-07-05T10:20:50.454408+00:00"},{"alias_kind":"pith_short_12","alias_value":"GDCMPX54JXAF","created_at":"2026-07-05T10:20:50.454408+00:00"},{"alias_kind":"pith_short_16","alias_value":"GDCMPX54JXAFCBOX","created_at":"2026-07-05T10:20:50.454408+00:00"},{"alias_kind":"pith_short_8","alias_value":"GDCMPX54","created_at":"2026-07-05T10:20:50.454408+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11740","citing_title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","ref_index":188,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00147","citing_title":"RareDxR1: Autonomous Medical Reasoning for Rare Disease Diagnosis Beyond Human Annotation","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03800","citing_title":"Trading Human Curation for Synthetic Augmentation in RLVR","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2603.27820","citing_title":"Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2507.17746","citing_title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19937","citing_title":"Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17928","citing_title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","ref_index":16,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5","json":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5.json","graph_json":"https://pith.science/api/pith-number/GDCMPX54JXAFCBOXGN5G2U5GN5/graph.json","events_json":"https://pith.science/api/pith-number/GDCMPX54JXAFCBOXGN5G2U5GN5/events.json","paper":"https://pith.science/paper/GDCMPX54"},"agent_actions":{"view_html":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5","download_json":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5.json","view_paper":"https://pith.science/paper/GDCMPX54","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.19655&json=true","fetch_graph":"https://pith.science/api/pith-number/GDCMPX54JXAFCBOXGN5G2U5GN5/graph.json","fetch_events":"https://pith.science/api/pith-number/GDCMPX54JXAFCBOXGN5G2U5GN5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5/action/storage_attestation","attest_author":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5/action/author_attestation","sign_citation":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5/action/citation_signature","submit_replication":"https://pith.science/pith/GDCMPX54JXAFCBOXGN5G2U5GN5/action/replication_record"}},"created_at":"2026-07-05T10:20:50.454408+00:00","updated_at":"2026-07-05T10:20:50.454408+00:00"}