Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T11:55:03.887091Z
Paper Citation Record · LEDGER
As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 8 inbound Pith citation observations for arXiv:2506.01096.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T11:55:03.887091Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-04T16:07:35.392271Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-04T10:09:44.995719Z
34 of 34 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation befbb2e6-afc4-4ca6-b717-624346b3f37c · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Chain-of-thought prompting elicits reasoning in large language models
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b64567fd-2c6f-4e78-b336-93790fcfb5c4 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Self-Consistency Improves Chain of Thought Reasoning in Language Models
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 22df4bdb-0ecf-42fe-9f2a-95eebf2250fd · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Language models are few-shot learners
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e489ebc3-cc2f-4070-8a70-64637c89b932 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bcd4c7a1-78ae-496b-8327-50f9e70e0ea2 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Automatic Chain of Thought Prompting in Large Language Models
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 28964c46-5547-4cfb-9622-825fff163593 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning GraphReason: Enhancing Reasoning Capabilities of Large Language Models through A Graph-Based Verification Approach
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 94df85cb-db32-452c-8c20-7f5a5de93bd6 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning A survey on test-time scaling in large language models: What, how, where, and how well?, 2025
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9338ddea-c370-4b9f-9e52-7648c2347d4a · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 21414b3c-ceb8-4ef5-bd79-08a078c9f758 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a969b981-7b64-4289-ba12-3d61c909853d · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Proximal policy optimization algorithms, 2017
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 03d3db60-1000-4849-9aa6-25c1a68c462d · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 307598cd-6566-4d6d-913e-09f248b5ed0a · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Off-policy deep reinforcement learning without exploration, 2019
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8ff2667a-f840-4707-9cb1-31dfb2a487bb · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Hindsight experience replay, 2018
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation abc38dc6-2f94-494e-b86a-b65268e36b42 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Stanley, and Jeff Clune
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 5290c543-ebdb-4740-bab8-1459b4cd6b8b · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 66b64877-5f87-45f8-9fc2-d3921434baa7 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b3c40d56-544e-4eb5-9c02-248ecbc58e44 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Le, Sergey Levine, and Yi Ma
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a4f97168-a213-4f81-b3c9-2d302dc6a4ad · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cf41f148-c6c9-49c2-8ced-fc8de2eb4132 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning An empirical study of catastrophic forgetting in large language models during continual fine-tuning, 2025
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 306ca55a-8977-4c43-b068-e7ae00219c95 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Understanding catastrophic forgetting in language models via implicit inference, 2024
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 8fa6a720-8bdc-4362-8e8c-d8a6ea5fc475 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Mitigating forgetting in llm supervised fine-tuning and preference learning, 2025
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 7760956e-231c-420d-9098-dd4431ee79b7 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation c994f4fb-60e2-4653-a303-8b40efe3183d · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification, 2025
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation f531e55b-b3be-4cf7-a260-6a016059b088 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Rlhf workflow: From reward modeling to online rlhf, 2024
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7fb36c3a-5c5a-4138-b997-813bbe4ba6ef · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Crowder, Darrien M
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b572a305-ed7f-472d-8378-deeb0e62d57e · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f13cb632-7ea4-4904-b1d0-f366d20484a3 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d2ca067d-23e6-4fbe-8ca9-5a00079695ab · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Qwen3 technical report, 2025
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 7c5fd51e-0392-4108-80d5-b889e39e837d · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Training verifiers to solve math word problems, 2021
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d5c1627-49cc-48f1-b045-a3fb593e2a90 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 434d5553-358d-418f-bc3a-f4b96d842bf7 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models, 2023
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cffc18b3-eda4-484a-b3b8-37a3de341bae · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Limo: Less is more for reasoning, 2025
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a69a6886-5641-4d42-a851-a7db21a2cc25 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Hitab: A hierarchical table dataset for question answering and natural language generation, 2022
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation d6d5564e-2666-4335-8238-642123a62d77 · outbound
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Let’s think step by step and output the final answer in boxed{}
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 90be6e53-f651-415a-b8a1-e2b32ae7e8e1 · inbound
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 610758d7-d080-41fe-9881-233359ab642e · inbound
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 110
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a2667e53-be8e-46f9-981c-14079b6fe28c · inbound
Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 57240f1c-a150-40d6-ae3d-47b02cb56f43 · inbound
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation cd5e782a-7809-47d7-a165-0c67046e81f1 · inbound
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 52
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation f2aca1d8-0c27-43b2-9113-1b2e1dc0225e · inbound
When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 92ee178a-556f-4350-8c19-7bb3efef8f13 · inbound
From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 141
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 5323e6c5-86e5-44d6-a07b-b521c3fe5daa · inbound
AIR: Adaptive Interleaved Reasoning with Code in MLLMs SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.