{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:Y2U5NYVN4EKXZONIBXZ54TTMBH","short_pith_number":"pith:Y2U5NYVN","schema_version":"1.0","canonical_sha256":"c6a9d6e2ade1157cb9a80df3de4e6c09f73ca6055127bfd264a6ce57288cb4fe","source":{"kind":"arxiv","id":"2503.23829","version":2},"attestation_state":"computed","paper":{"title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dian Yu, Dong Yu, Haitao Mi, Juntao Li, Linfeng Song, Min Zhang, Yi Su, Zhaopeng Tu","submitted_at":"2025-03-31T08:22:49Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) has demonstrated significant success in enhancing mathematical reasoning and coding performance of large language models (LLMs), especially when structured reference answers are accessible for verification. However, its extension to broader, less structured domains remains unexplored. In this work, we investigate the effectiveness and scalability of RLVR across diverse real-world domains including medicine, chemistry, psychology, economics, and education, where structured reference answers are typically unavailable. We reveal that binary ve"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.23829","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-03-31T08:22:49Z","cross_cats_sorted":[],"title_canon_sha256":"b2d59fffc3d2b4b9866e4ed14c455763266ab281591c507d802a5c399c537f56","abstract_canon_sha256":"ce205d715eee78df98d3cc04f2f4f6f9bbea23f1173f7b9eb925540abd4e5473"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:42:46.087755Z","signature_b64":"L8Yy82mXbT8r/qqtpARzIjbyzTnc9VsProWZtH57y20caQZP5wwjsFXl6EZv2QfLkk9pZBgA5Nuk9I8fmY7GCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c6a9d6e2ade1157cb9a80df3de4e6c09f73ca6055127bfd264a6ce57288cb4fe","last_reissued_at":"2026-07-05T10:42:46.087253Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:42:46.087253Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dian Yu, Dong Yu, Haitao Mi, Juntao Li, Linfeng Song, Min Zhang, Yi Su, Zhaopeng Tu","submitted_at":"2025-03-31T08:22:49Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) has demonstrated significant success in enhancing mathematical reasoning and coding performance of large language models (LLMs), especially when structured reference answers are accessible for verification. However, its extension to broader, less structured domains remains unexplored. In this work, we investigate the effectiveness and scalability of RLVR across diverse real-world domains including medicine, chemistry, psychology, economics, and education, where structured reference answers are typically unavailable. We reveal that binary ve"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.23829","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.23829/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.23829","created_at":"2026-07-05T10:42:46.087326+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.23829v2","created_at":"2026-07-05T10:42:46.087326+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.23829","created_at":"2026-07-05T10:42:46.087326+00:00"},{"alias_kind":"pith_short_12","alias_value":"Y2U5NYVN4EKX","created_at":"2026-07-05T10:42:46.087326+00:00"},{"alias_kind":"pith_short_16","alias_value":"Y2U5NYVN4EKXZONI","created_at":"2026-07-05T10:42:46.087326+00:00"},{"alias_kind":"pith_short_8","alias_value":"Y2U5NYVN","created_at":"2026-07-05T10:42:46.087326+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24539","citing_title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23557","citing_title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02407","citing_title":"Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09393","citing_title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00139","citing_title":"Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04516","citing_title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00172","citing_title":"CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28707","citing_title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31058","citing_title":"Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00609","citing_title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20061","citing_title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2506.13351","citing_title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2509.25454","citing_title":"DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2510.10649","citing_title":"Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2512.03847","citing_title":"DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2601.13262","citing_title":"CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2603.16876","citing_title":"Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation","ref_index":106,"is_internal_anchor":false},{"citing_arxiv_id":"2603.03197","citing_title":"Specificity-aware reinforcement learning for fine-grained open-world classification","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2507.17746","citing_title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09879","citing_title":"M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20755","citing_title":"V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10110","citing_title":"Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00754","citing_title":"Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02913","citing_title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","ref_index":105,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00754","citing_title":"Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH","json":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH.json","graph_json":"https://pith.science/api/pith-number/Y2U5NYVN4EKXZONIBXZ54TTMBH/graph.json","events_json":"https://pith.science/api/pith-number/Y2U5NYVN4EKXZONIBXZ54TTMBH/events.json","paper":"https://pith.science/paper/Y2U5NYVN"},"agent_actions":{"view_html":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH","download_json":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH.json","view_paper":"https://pith.science/paper/Y2U5NYVN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.23829&json=true","fetch_graph":"https://pith.science/api/pith-number/Y2U5NYVN4EKXZONIBXZ54TTMBH/graph.json","fetch_events":"https://pith.science/api/pith-number/Y2U5NYVN4EKXZONIBXZ54TTMBH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH/action/storage_attestation","attest_author":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH/action/author_attestation","sign_citation":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH/action/citation_signature","submit_replication":"https://pith.science/pith/Y2U5NYVN4EKXZONIBXZ54TTMBH/action/replication_record"}},"created_at":"2026-07-05T10:42:46.087326+00:00","updated_at":"2026-07-05T10:42:46.087326+00:00"}