{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:LZ2YREIDXGXE5UB6E72J7UES5T","short_pith_number":"pith:LZ2YREID","schema_version":"1.0","canonical_sha256":"5e75889103b9ae4ed03e27f49fd092ecfc7057903ccc22e246742a21969bc023","source":{"kind":"arxiv","id":"2504.13950","version":1},"attestation_state":"computed","paper":{"title":"Open-Medical-R1: How to Choose Data for RLVR Training at Medicine Domain","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Heng Li, Jiang Liu, Yan Hu, Zhang Zhang, Zhongxi Qiu","submitted_at":"2025-04-16T09:16:12Z","abstract_excerpt":"This paper explores optimal data selection strategies for Reinforcement Learning with Verified Rewards (RLVR) training in the medical domain. While RLVR has shown exceptional potential for enhancing reasoning capabilities in large language models, most prior implementations have focused on mathematics and logical puzzles, with limited exploration of domain-specific applications like medicine. We investigate four distinct data sampling strategies from MedQA-USMLE: random sampling (baseline), and filtering using Phi-4, Gemma-3-27b-it, and Gemma-3-12b-it models. Using Gemma-3-12b-it as our base m"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.13950","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-16T09:16:12Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"5af46fa9aa20b8972f092c5c0064c90d3e51c08497d22a15ab75b3b8d0346ed0","abstract_canon_sha256":"cb852cab1081493099ac38d81cb26a6b0731620667bf7f2505c280ca97d6d5ba"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:51:08.631438Z","signature_b64":"7+bXqWLPSyqZVpYm+66l6XOCNeylvN+BpDx/WWWYSdQ6jV2dVY9Gk5Ib5BlCTFw844tlraFUs8EJP3Ii0FIBBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5e75889103b9ae4ed03e27f49fd092ecfc7057903ccc22e246742a21969bc023","last_reissued_at":"2026-07-05T10:51:08.630938Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:51:08.630938Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Open-Medical-R1: How to Choose Data for RLVR Training at Medicine Domain","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Heng Li, Jiang Liu, Yan Hu, Zhang Zhang, Zhongxi Qiu","submitted_at":"2025-04-16T09:16:12Z","abstract_excerpt":"This paper explores optimal data selection strategies for Reinforcement Learning with Verified Rewards (RLVR) training in the medical domain. While RLVR has shown exceptional potential for enhancing reasoning capabilities in large language models, most prior implementations have focused on mathematics and logical puzzles, with limited exploration of domain-specific applications like medicine. We investigate four distinct data sampling strategies from MedQA-USMLE: random sampling (baseline), and filtering using Phi-4, Gemma-3-27b-it, and Gemma-3-12b-it models. Using Gemma-3-12b-it as our base m"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.13950","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.13950/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.13950","created_at":"2026-07-05T10:51:08.630999+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.13950v1","created_at":"2026-07-05T10:51:08.630999+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.13950","created_at":"2026-07-05T10:51:08.630999+00:00"},{"alias_kind":"pith_short_12","alias_value":"LZ2YREIDXGXE","created_at":"2026-07-05T10:51:08.630999+00:00"},{"alias_kind":"pith_short_16","alias_value":"LZ2YREIDXGXE5UB6","created_at":"2026-07-05T10:51:08.630999+00:00"},{"alias_kind":"pith_short_8","alias_value":"LZ2YREID","created_at":"2026-07-05T10:51:08.630999+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07761","citing_title":"Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning","ref_index":97,"is_internal_anchor":true},{"citing_arxiv_id":"2605.04499","citing_title":"Pen-Strategist: A Reasoning Framework for Penetration Testing Strategy Formation and Analysis","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17928","citing_title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T","json":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T.json","graph_json":"https://pith.science/api/pith-number/LZ2YREIDXGXE5UB6E72J7UES5T/graph.json","events_json":"https://pith.science/api/pith-number/LZ2YREIDXGXE5UB6E72J7UES5T/events.json","paper":"https://pith.science/paper/LZ2YREID"},"agent_actions":{"view_html":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T","download_json":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T.json","view_paper":"https://pith.science/paper/LZ2YREID","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.13950&json=true","fetch_graph":"https://pith.science/api/pith-number/LZ2YREIDXGXE5UB6E72J7UES5T/graph.json","fetch_events":"https://pith.science/api/pith-number/LZ2YREIDXGXE5UB6E72J7UES5T/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T/action/storage_attestation","attest_author":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T/action/author_attestation","sign_citation":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T/action/citation_signature","submit_replication":"https://pith.science/pith/LZ2YREIDXGXE5UB6E72J7UES5T/action/replication_record"}},"created_at":"2026-07-05T10:51:08.630999+00:00","updated_at":"2026-07-05T10:51:08.630999+00:00"}