Pith. sign in

Paper Citation Record · LEDGER

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 8 inbound Pith citation observations for arXiv:2507.17512.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.17512 v1

Coverage vector

measured 49 of 49 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T14:53:04.687922Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:34:03.334852Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T18:30:01.593067Z

Reference resolution

49 of 49 outbound references displayed

  • verified exact2
  • verified fuzzy6
  • unresolved40
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8540c431-317c-4b6c-a656-283e69872171 · outbound

This paper cites Program synthesis with large language models, 2021.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Program synthesis with large language models, 2021

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.403637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.403637Z digest=sha256:c9548fed645ca717048f2033d550bc24428566ca276fde1bac01a5fb6e6694c2

Observation 464c56b1-320b-4356-b72a-904b3294ae01 · outbound

This paper cites The logic puzzle baron dataset.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning The logic puzzle baron dataset

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:53:06.233755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.410008Z digest=sha256:f22b4f1e85d7afdc3419d0c5af87ce595073ebf4c585cf5a4032da09728dba96

Observation 36c4b4ae-a02e-4d87-8706-ad3c159a4e66 · outbound

This paper cites SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.416178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.416178Z digest=sha256:a1dc1d68b6400d63d69c15b26fbcca5e27a14b947fa23b4e4cce6d32e3c3e9a4

Observation aec1e64f-9f69-469d-95c6-bdf1145e592d · outbound

This paper cites an unresolved cited work.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.422667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.422667Z digest=sha256:d55fa1ff6dee3e1a66b7d8ad613841b9df5332dca93b53790e77440f1b762ebc

Observation 50bab17c-3824-428f-bc18-762d56417cda · outbound

This paper cites Self-evolving curriculum for llm reasoning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Self-evolving curriculum for llm reasoning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.428206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.428206Z digest=sha256:8177ee7e1df2c767e58e46e89869d21f86437261b2a95f27775f3fa6344d05be

Observation b9bdd950-b7f5-4e21-a924-d2cb42fa0ff3 · outbound

This paper cites SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.433304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.433304Z digest=sha256:52069dc75bfa7470996d89de773592d538cfefa845d846eb315965d442302783

Observation db7dce01-0a46-45a0-bb37-0a54dfe30f21 · outbound

This paper cites Opencompass: A universal evaluation platform for foundation models.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Opencompass: A universal evaluation platform for foundation models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.440151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.440151Z digest=sha256:07d6b8e9a76263d7817613112aaae721e0ff4ba177e1247120e74559c3dbd170

Observation 24e56876-24b6-4871-9f3c-a7b0858efbec · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.446447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.446447Z digest=sha256:9be55506730532c266e2e1950c6f536149af17c64b72f1a6603b9fb7e0fd37be

Observation 5e7aed1c-a2a7-43bd-b6f3-d7e3c7508252 · outbound

This paper cites Does Prompt Formatting Have Any Impact on LLM Performance?.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Does Prompt Formatting Have Any Impact on LLM Performance?

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.452317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.452317Z digest=sha256:08dc784039e60d302fe29b421aac3b5dfd19b812e1bbd7b8c4da53b086d312fd

Observation b9856231-50db-48a3-b3a6-f705f7c8002f · outbound

This paper cites Measuring mathematical problem solving with the math dataset.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Measuring mathematical problem solving with the math dataset

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.459338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.459338Z digest=sha256:e1e9c8fc06dd516b48cbe10b2aaf18b9e197def8748dd7b16d69848ee4df4b4d

Observation feed8f47-1a9a-4384-a9c7-ed405b8148db · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.466420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.466420Z digest=sha256:c6a2fd46d760e8d559b6686d388a600c86899ec5e1d9a1228c549ddd581ebbf3

Observation 51949e84-a341-4780-b585-e1b79be1963d · outbound

This paper cites Curricularface: adaptive curriculum learning loss for deep face recognition.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Curricularface: adaptive curriculum learning loss for deep face recognition

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:53:06.164700Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.472280Z digest=sha256:b468550ee0b2fc0b2e6eb5ab9cd8b66a750f28b33bae412e6524f5dc6ede7033

Observation 3b5b79ad-7d6a-4e51-b6ee-a8edd4a7b281 · outbound

This paper cites ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.480460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.480460Z digest=sha256:8f02f69e4e135be956cbd7ee6868d27ddce0648b5440c605e8caf4913f5e9f73

Observation b249235c-fc04-4432-860f-86db0789011f · outbound

This paper cites Adaptive curriculum learning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Adaptive curriculum learning

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:53:06.142850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.485559Z digest=sha256:93bb2d07b800a706031245ea74c64aa64195d8a27dfb2a7a35e94325123fb23f

Observation 261eacb5-8c18-4f70-be85-b4b4db4152cc · outbound

This paper cites TACO: Topics in Algorithmic COde generation dataset.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning TACO: Topics in Algorithmic COde generation dataset

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.490769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.490769Z digest=sha256:33b4aade035f1e4ae65aa60072167d3c42809a21d2f37f21d06d30938680958a

Observation 5794391c-270b-4b53-994c-3bcafb3f61d8 · outbound

This paper cites CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:53:05.622671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.495978Z digest=sha256:ead87c9e6b5d05baba04b216b4ec111aa810eb625ddb2fc208ec9ea01caf3656

Observation 0c02e523-1b76-405a-a274-961ce3ec2b8b · outbound

This paper cites ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.502280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.502280Z digest=sha256:24d3ec6c40552aa4defde6df8418891b2017f71f9626c65b2d975671c5b3ddb5

Observation 0c83de3e-6965-4c84-83dc-a110bbc069b0 · outbound

This paper cites Code-r1: Reproducing r1 for code with reliable rewards.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Code-r1: Reproducing r1 for code with reliable rewards

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.507621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.507621Z digest=sha256:ea97aeebb6aed49a6552a066f25288b778e8d5a33add07ff211cb760601872fd

Observation 3dd56042-bd00-4b39-9500-092af60b8646 · outbound

This paper cites ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.512694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.512694Z digest=sha256:7d90d277eb0fb325044a6f69a58fa8d1f56900836f63bded98980b145f8f1571

Observation f4a4d1ef-71e3-4ae2-8d71-3a57ec56a047 · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Understanding R1-Zero-Like Training: A Critical Perspective

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.518303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.518303Z digest=sha256:2a6b33763e072da878526c50d12d37a2e4a4f07b85acae04260df693b9082f63

Observation 27c200c6-d8f8-460b-9b1f-604d7cd6228f · outbound

This paper cites Deepscaler: Sur- passing o1-preview with a 1.5b model by scaling rl.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Deepscaler: Sur- passing o1-preview with a 1.5b model by scaling rl

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:53:05.956790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.524453Z digest=sha256:6380b86e8f8b39115ccbe3251a8f8ab474fcf6eda05047245b5a0ce1260c5155

Observation c6d95a42-802e-42a9-9bd9-fdee215ffeaf · outbound

This paper cites Tinyzero.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Tinyzero

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.529918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.529918Z digest=sha256:ddee7f755d93748a951dfe15d8bdd2f8bfd6e3cff7320eb684d86d0956e3aeb2

Observation 7a590a8f-5024-4596-8016-5eadc3dde457 · outbound

This paper cites LEMMA: Learning from Errors for MatheMatical Advancement in LLMs.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning LEMMA: Learning from Errors for MatheMatical Advancement in LLMs

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:53:05.531253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.535669Z digest=sha256:34f7ef8f9a5068f64084583fcca99402111f269b01c977450f18cca9d7b8b68f

Observation b4698c59-ecbb-4409-b14c-54f31f80b53c · outbound

This paper cites REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.542163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.542163Z digest=sha256:6ebc65d80e285d3f49f7fb235e0b5969a1c481d4fa301fa7ac14f925141e5f15

Observation 4600ec2e-47c3-431b-93fc-a06241d32518 · outbound

This paper cites Curriculum reinforcement learning from easy to hard tasks improves llm reasoning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Curriculum reinforcement learning from easy to hard tasks improves llm reasoning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.548107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.548107Z digest=sha256:64080946b3531ce3927777acb2b6652076ff315ac2439bd041ceb7261bbc2ef6

Observation 53c1ef05-4ca3-4a33-b9c0-7412ce87bb1c · outbound

This paper cites MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.553391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.553391Z digest=sha256:e1ef2266c0521fa2b725c0cd03a14b970515d64404e164167a05200afc713147

Observation 077eda26-b9da-431c-8fa9-41f7b564eaea · outbound

This paper cites Qwen2.5 Technical Report.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Qwen2.5 Technical Report

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.559294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.559294Z digest=sha256:02d30bba3649317bc93b4973b75d5e329f022e742122ed510000788ce4f9e6ed

Observation 47fa10e6-114b-4b08-b746-7b13c998cd2c · outbound

This paper cites Magistral.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Magistral

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.564942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.564942Z digest=sha256:7af1813d6473cb8f799b400f9130f48910c664d524aec0ec3e5ad712a8dc90bf

Observation 7957b7bc-3abb-4142-aca0-64e57cae02a1 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.570905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.570905Z digest=sha256:12c8704544a8f91d83c89cfb1d8146e50920687a6f462fa330a357acd39589ef

Observation e594da3a-4ceb-47cd-ba87-bc49fec21a34 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.577219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.577219Z digest=sha256:180375c8a91ccea05a1b94cf04871b475337f27526304b919550a20479eff28e

Observation d22d86bc-084c-4173-b982-0f7168f298a1 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning HybridFlow: A Flexible and Efficient RLHF Framework

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.582727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.582727Z digest=sha256:7f19d99ec3d1932aa8b7a111fd2eaf3d79c233338dbb7e419e43ce94c78b7752

Observation 4997eec7-ee4f-4ac5-9d6e-a3b5f46a16d6 · outbound

This paper cites Template matters: Understanding the role of instruction templates in multimodal language model evaluation and training.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Template matters: Understanding the role of instruction templates in multimodal language model evaluation and training

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:53:05.922540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.589065Z digest=sha256:9097da3f0edc2646c42a21d5c208480bf1e6a0b9c317e53602c31b55706113da

Observation 94f85e59-22da-4291-a53f-247c92d11336 · outbound

This paper cites Dump: Automated distribution-level curriculum learning for rl-based llm post-training.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Dump: Automated distribution-level curriculum learning for rl-based llm post-training

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.593968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.593968Z digest=sha256:3216eded65dc2d7937c95b58c3b593b72762fc9d978a6817d7760a6888f78691

Observation f940d917-eda9-44d6-8168-e3c54efb1326 · outbound

This paper cites Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.599526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.599526Z digest=sha256:8092d5e4519a6adf067e6f5c18ff6daa2797b62873329b7284f96ac1618dce11

Observation 69731711-117f-4cc1-9a86-23b321ce36c5 · outbound

This paper cites Rlvr-world: Training world models with reinforcement learning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Rlvr-world: Training world models with reinforcement learning

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.605833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.605833Z digest=sha256:d94a30784fd24f612f776d45a526824e26b4b28f25a5655351ecce5d1d3bfb89

Observation a669a212-d3d2-46c4-8b50-39da3cbb3553 · outbound

This paper cites LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.611175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.611175Z digest=sha256:fb6a03faeda48bbef58cf22f414277b6e63bdd1256b2e7df61d63ddbd0e51f10

Observation 6d631812-2c58-4900-962d-551e04168dad · outbound

This paper cites On Memorization of Large Language Models in Logical Reasoning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning On Memorization of Large Language Models in Logical Reasoning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.617685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.617685Z digest=sha256:33c1d681112217218de190e5bccbb6d080b91544d87c912162658a0c09220550

Observation 4b79c033-5867-4008-8c43-bec4f22f60a7 · outbound

This paper cites Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.623265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.623265Z digest=sha256:92600eda7d56379909c44067317270cf205832a25ae9df16ca90357f13fb4f4a

Observation b28d8b18-0fdc-4bd4-b0b3-287c237b2b98 · outbound

This paper cites RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.629639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.629639Z digest=sha256:e09cd7413afefa46cd1e90d9e662557f98067b6c7be8f51d2cd81abd132c8f19

Observation 63e26268-c21f-4897-a037-d1ba1f9f364a · outbound

This paper cites Qwen2 Technical Report.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Qwen2 Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.635611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.635611Z digest=sha256:6fe9c980491c39a2233a4329b042e1550c565e2b57bce41220436cca0f08e929

Observation c6b7f1a6-fa47-440d-b4b6-a80fb28074b2 · outbound

This paper cites Demystifying Long Chain-of-Thought Reasoning in LLMs.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Demystifying Long Chain-of-Thought Reasoning in LLMs

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.641309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.641309Z digest=sha256:568d80e81cf4fdaf48e8abfc0343f688f04531295ac8a4a4981b7cf4e62e4c61

Observation 79755e74-e6e5-458f-b5dd-2e89aacd48ca · outbound

This paper cites RLPR: Extrapolating RLVR to General Domains without Verifiers.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning RLPR: Extrapolating RLVR to General Domains without Verifiers

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.646543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.646543Z digest=sha256:ac824f4de5b7b0834a6de4042a7dc523a8905c64db61e4a5d4098477df942688

Observation 59e5017b-f635-496d-8b23-47ff0b60d0d2 · outbound

This paper cites Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Bias.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Bias

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.652198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.652198Z digest=sha256:91b55bb37b30da85c2783f9c575ee0a4f08669f55d2e2512b4da83b2651a6d70

Observation fe1abd00-ca2c-45df-9a78-b2c81c3541b0 · outbound

This paper cites Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.657958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.657958Z digest=sha256:ebee5649398e70bc31d35b0605b10a816ea05bbb4ea9001b4fc105fdaaea07f7

Observation 1d29a49b-588a-4212-814d-3619556a7145 · outbound

This paper cites SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T14:53:04.664420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.664420Z digest=sha256:6ba63cb6422fba0625147cd451e16d5f3adb866a0fcf7fa84674513d73e5b61a

Observation 470444a5-3dd0-47fa-9d4b-5ef8075be893 · outbound

This paper cites R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Reference 46

Resolution
malformed identifier
no resolver link, observed 2026-08-06T14:53:04.670074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:53:04.670074Z digest=sha256:2d95a381cfb86cca4f50ac296b06c5959ec1c936e93fd2c56c8af3514b1c3788

Observation 512ecb7e-3785-48d7-9f99-53c430f3bf9a · outbound

This paper cites an unresolved cited work.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-06T14:53:05.904785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.676524Z digest=sha256:183e206c1d1b43e2727ba52351abec2ea3d05e9605f253493d36baae69c06fec

Observation 14022813-be9f-4096-be30-4c9619cce5f5 · outbound

This paper cites an unresolved cited work.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-06T14:53:05.887391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.682076Z digest=sha256:dfe65d1c74bbf2112de14f7af5e2b597b087e5434a0d8844c5c975e90e8b4adc

Observation 95e095bf-ebff-4d3b-96b0-f247b1a9de44 · outbound

This paper cites ## Answer to the Example Puzzle { ”reasoning”: ”Given Clue 1, we know Peter is in House 2.

Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning ## Answer to the Example Puzzle { ”reasoning”: ”Given Clue 1, we know Peter is in House 2

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:53:05.870440Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:53:04.687922Z digest=sha256:c0cf51c608e1214d024791e8c0b822e6ca749f72b32e8c92f6d2497bed09c820

Pith citing papers

Observation fd3b1ad9-d1ca-4d57-b2a2-a2d6d004ee21 · inbound

G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning cites this paper.

G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:34:03.334852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:34:03.334852Z digest=sha256:adb0948f3cddc4c3a394d5f37b8f1c2862efab401b2c67f0449ad5fd2c04cfc5

Observation 9b320f60-a5de-4d56-91f8-c19802459a26 · inbound

From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments cites this paper.

From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 205

Resolution
verified exact
arxiv_id, observed 2026-05-15T01:23:27.214745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T01:20:03.181903Z digest=sha256:34e15c8873a07ec2ebcacd299930a110b5aa56fc766f4ab8c8f0843361e0e86e

Observation 868a42ff-7788-4660-89ec-71efa5ffe279 · inbound

Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs cites this paper.

Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:06:00.589898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T16:14:38.371700Z digest=sha256:71600593c4005f4d272925b8f1a95bc498b2e977357b193333eacfc41a078861

Observation a0e06f9f-0451-42f5-839a-a005cbc642e2 · inbound

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It cites this paper.

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 69

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T05:37:40.383704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T13:08:57.218711Z digest=sha256:1c8180d568524cfb0b74d7deb4535363df12f860ebff91f6e8c1f4df95bff5e4

Observation 580515ac-9341-46d5-9a85-50c4309ae4a5 · inbound

From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning cites this paper.

From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 69

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T20:58:58.333309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T00:59:50.038405Z digest=sha256:42bb6f044c73b2e04c578f702dbbb4353c89845cf7b8f02f013d438c1027c098

Observation 5b202722-a2a8-4412-82fa-adf9ed5d7520 · inbound

Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR cites this paper.

Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-07-04T18:30:01.594743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-25T22:47:09.330723Z digest=sha256:8164e71b00fd939c71753173216a4f6c08722f37de3baa45f7bc195bc861be3d

Observation e3968d58-d029-4d7f-a656-7917cb6cc049 · inbound

Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR cites this paper.

Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-06-30T12:54:40.490774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-30T09:55:19.804589Z digest=sha256:1c4444942fcb38cf198c0b2a3db09f330affac29a47b1ed2a4befdf46711dfda

Observation b0b85819-9a32-450d-990c-f7710a6cf889 · inbound

Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning cites this paper.

Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-04T21:54:44.286875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T21:54:44.286875Z digest=sha256:6eddb1f3c891303d050b13ac0d5d142fc32f635ecd132da58295b7a0bfbc17e4