Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T14:53:04.687922Z
Paper Citation Record · LEDGER
As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 8 inbound Pith citation observations for arXiv:2507.17512.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T14:53:04.687922Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-07T14:34:03.334852Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-04T18:30:01.593067Z
49 of 49 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 8540c431-317c-4b6c-a656-283e69872171 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Program synthesis with large language models, 2021
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 464c56b1-320b-4356-b72a-904b3294ae01 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning The logic puzzle baron dataset
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 36c4b4ae-a02e-4d87-8706-ad3c159a4e66 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation aec1e64f-9f69-469d-95c6-bdf1145e592d · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Unresolved cited work
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 50bab17c-3824-428f-bc18-762d56417cda · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Self-evolving curriculum for llm reasoning
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b9bdd950-b7f5-4e21-a924-d2cb42fa0ff3 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation db7dce01-0a46-45a0-bb37-0a54dfe30f21 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Opencompass: A universal evaluation platform for foundation models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 24e56876-24b6-4871-9f3c-a7b0858efbec · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5e7aed1c-a2a7-43bd-b6f3-d7e3c7508252 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Does Prompt Formatting Have Any Impact on LLM Performance?
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b9856231-50db-48a3-b3a6-f705f7c8002f · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Measuring mathematical problem solving with the math dataset
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation feed8f47-1a9a-4384-a9c7-ed405b8148db · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 51949e84-a341-4780-b585-e1b79be1963d · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Curricularface: adaptive curriculum learning loss for deep face recognition
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 3b5b79ad-7d6a-4e51-b6ee-a8edd4a7b281 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b249235c-fc04-4432-860f-86db0789011f · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Adaptive curriculum learning
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 261eacb5-8c18-4f70-be85-b4b4db4152cc · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning TACO: Topics in Algorithmic COde generation dataset
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5794391c-270b-4b53-994c-3bcafb3f61d8 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 0c02e523-1b76-405a-a274-961ce3ec2b8b · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0c83de3e-6965-4c84-83dc-a110bbc069b0 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Code-r1: Reproducing r1 for code with reliable rewards
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3dd56042-bd00-4b39-9500-092af60b8646 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f4a4d1ef-71e3-4ae2-8d71-3a57ec56a047 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Understanding R1-Zero-Like Training: A Critical Perspective
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 27c200c6-d8f8-460b-9b1f-604d7cd6228f · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Deepscaler: Sur- passing o1-preview with a 1.5b model by scaling rl
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation c6d95a42-802e-42a9-9bd9-fdee215ffeaf · outbound
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7a590a8f-5024-4596-8016-5eadc3dde457 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning LEMMA: Learning from Errors for MatheMatical Advancement in LLMs
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b4698c59-ecbb-4409-b14c-54f31f80b53c · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4600ec2e-47c3-431b-93fc-a06241d32518 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Curriculum reinforcement learning from easy to hard tasks improves llm reasoning
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 53c1ef05-4ca3-4a33-b9c0-7412ce87bb1c · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 077eda26-b9da-431c-8fa9-41f7b564eaea · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Qwen2.5 Technical Report
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 47fa10e6-114b-4b08-b746-7b13c998cd2c · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Magistral
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7957b7bc-3abb-4142-aca0-64e57cae02a1 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Proximal Policy Optimization Algorithms
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e594da3a-4ceb-47cd-ba87-bc49fec21a34 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d22d86bc-084c-4173-b982-0f7168f298a1 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning HybridFlow: A Flexible and Efficient RLHF Framework
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4997eec7-ee4f-4ac5-9d6e-a3b5f46a16d6 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Template matters: Understanding the role of instruction templates in multimodal language model evaluation and training
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 94f85e59-22da-4291-a53f-247c92d11336 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Dump: Automated distribution-level curriculum learning for rl-based llm post-training
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f940d917-eda9-44d6-8168-e3c54efb1326 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 69731711-117f-4cc1-9a86-23b321ce36c5 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Rlvr-world: Training world models with reinforcement learning
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a669a212-d3d2-46c4-8b50-39da3cbb3553 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6d631812-2c58-4900-962d-551e04168dad · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning On Memorization of Large Language Models in Logical Reasoning
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4b79c033-5867-4008-8c43-bec4f22f60a7 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b28d8b18-0fdc-4bd4-b0b3-287c237b2b98 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 63e26268-c21f-4897-a037-d1ba1f9f364a · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Qwen2 Technical Report
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c6b7f1a6-fa47-440d-b4b6-a80fb28074b2 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Demystifying Long Chain-of-Thought Reasoning in LLMs
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 79755e74-e6e5-458f-b5dd-2e89aacd48ca · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning RLPR: Extrapolating RLVR to General Domains without Verifiers
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 59e5017b-f635-496d-8b23-47ff0b60d0d2 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Bias
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fe1abd00-ca2c-45df-9a78-b2c81c3541b0 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1d29a49b-588a-4212-814d-3619556a7145 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 470444a5-3dd0-47fa-9d4b-5ef8075be893 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 512ecb7e-3785-48d7-9f99-53c430f3bf9a · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Unresolved cited work
Reference 47
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 14022813-be9f-4096-be30-4c9619cce5f5 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Unresolved cited work
Reference 48
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 95e095bf-ebff-4d3b-96b0-f247b1a9de44 · outbound
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ## Answer to the Example Puzzle { ”reasoning”: ”Given Clue 1, we know Peter is in House 2
Reference 49
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation fd3b1ad9-d1ca-4d57-b2a2-a2d6d004ee21 · inbound
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9b320f60-a5de-4d56-91f8-c19802459a26 · inbound
From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 205
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 868a42ff-7788-4660-89ec-71efa5ffe279 · inbound
Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation a0e06f9f-0451-42f5-839a-a005cbc642e2 · inbound
Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 69
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 580515ac-9341-46d5-9a85-50c4309ae4a5 · inbound
From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 69
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 5b202722-a2a8-4412-82fa-adf9ed5d7520 · inbound
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation e3968d58-d029-4d7f-a656-7917cb6cc049 · inbound
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b0b85819-9a32-450d-990c-f7710a6cf889 · inbound
Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Reference 66
Source-reported events for the cited work
Unavailable: canonical work link unavailable.