Pith. sign in

Paper Citation Record · LEDGER

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 8 inbound Pith citation observations for arXiv:2506.01096.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.01096 v2

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:55:03.887091Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T16:07:35.392271Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T10:09:44.995719Z

Reference resolution

34 of 34 outbound references displayed

  • verified exact0
  • verified fuzzy10
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation befbb2e6-afc4-4ca6-b717-624346b3f37c · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Chain-of-thought prompting elicits reasoning in large language models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.083828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.083828Z digest=sha256:a54ba2f4f2d1c78aa6b98565b3ba09134a352aa7381dd662ab818d5af95946c5

Observation b64567fd-2c6f-4e78-b336-93790fcfb5c4 · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.113151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.113151Z digest=sha256:c3827c50da395fbc71360905b3910170aeeef8f4dc0e3050145d78a6e1b63f52

Observation 22df4bdb-0ecf-42fe-9f2a-95eebf2250fd · outbound

This paper cites Language models are few-shot learners.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Language models are few-shot learners

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.137006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.137006Z digest=sha256:f10741f929695f1181cf2363fa3b30563d89501bb2540e19928a784eedef8fb8

Observation e489ebc3-cc2f-4070-8a70-64637c89b932 · outbound

This paper cites Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.162009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.162009Z digest=sha256:0e580547a51fb4ae058adc8aef67f7aaccb1b47b1702a030e1c68024ef6b3913

Observation bcd4c7a1-78ae-496b-8327-50f9e70e0ea2 · outbound

This paper cites Automatic Chain of Thought Prompting in Large Language Models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Automatic Chain of Thought Prompting in Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.190168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.190168Z digest=sha256:3fad69cd3cc9db05a1538c86b8f285bfe953f4e55510a1a0efe0d9f2fdad9b25

Observation 28964c46-5547-4cfb-9622-825fff163593 · outbound

This paper cites GraphReason: Enhancing Reasoning Capabilities of Large Language Models through A Graph-Based Verification Approach.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning GraphReason: Enhancing Reasoning Capabilities of Large Language Models through A Graph-Based Verification Approach

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.225522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.225522Z digest=sha256:c8f4a265054747b4e04e66823c7bdca2b655ab6aa7a2d2b03114c5978820f06a

Observation 94df85cb-db32-452c-8c20-7f5a5de93bd6 · outbound

This paper cites A survey on test-time scaling in large language models: What, how, where, and how well?, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning A survey on test-time scaling in large language models: What, how, where, and how well?, 2025

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.258257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.258257Z digest=sha256:fec4a005ff38e1be7b14e9fb57b2f318789772b8d7191594c87048e5c9bc199f

Observation 9338ddea-c370-4b9f-9e52-7648c2347d4a · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.285532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.285532Z digest=sha256:5802389bb81f6f88db514403fbb125214490682f83d85b34054f6f7b4df64b32

Observation 21414b3c-ceb8-4ef5-bd79-08a078c9f758 · outbound

This paper cites an unresolved cited work.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.314686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.314686Z digest=sha256:f65c0dc2ebba813cbd87136eec94db4ec14e082b10118eff483c1b66fccb1c11

Observation a969b981-7b64-4289-ba12-3d61c909853d · outbound

This paper cites Proximal policy optimization algorithms, 2017.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Proximal policy optimization algorithms, 2017

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.617153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.334322Z digest=sha256:caf58ccd219623c9ee39ad21feb627b37c547d8bebd9b916ba38afa4cbc6a153

Observation 03d3db60-1000-4849-9aa6-25c1a68c462d · outbound

This paper cites Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.363724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.363724Z digest=sha256:b6886874ec5821b472b3a88b39f941426aa22dcbe46c0d02a8733b470e1d2fe6

Observation 307598cd-6566-4d6d-913e-09f248b5ed0a · outbound

This paper cites Off-policy deep reinforcement learning without exploration, 2019.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Off-policy deep reinforcement learning without exploration, 2019

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.392816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.392816Z digest=sha256:05067eefce29afc9bc9b6825468d328b8464d670832c4b4555fbe9e4c0145bde

Observation 8ff2667a-f840-4707-9cb1-31dfb2a487bb · outbound

This paper cites Hindsight experience replay, 2018.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Hindsight experience replay, 2018

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.418313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.418313Z digest=sha256:1b56bf4e66579a2a43f8e1e06d031501d69b8f8f3b8f83f208efc606855c96ce

Observation abc38dc6-2f94-494e-b86a-b65268e36b42 · outbound

This paper cites Stanley, and Jeff Clune.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Stanley, and Jeff Clune

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.539004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.444735Z digest=sha256:0f7958c3544849c5649d4180d8e85c6eddb37e6f4582223592692ad55ff467da

Observation 5290c543-ebdb-4740-bab8-1459b4cd6b8b · outbound

This paper cites Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.461762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.461762Z digest=sha256:09ba4d39e46bb9338a4865e3f6f69dfd60dce2cf667efc0cb5fc7de1394d807e

Observation 66b64877-5f87-45f8-9fc2-d3921434baa7 · outbound

This paper cites an unresolved cited work.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.478502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.478502Z digest=sha256:c20ff9c49c221d12591ae3197d82ed67cf0e2cf16ee42d73e1574b1b3f08273f

Observation b3c40d56-544e-4eb5-9c02-248ecbc58e44 · outbound

This paper cites Le, Sergey Levine, and Yi Ma.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Le, Sergey Levine, and Yi Ma

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.503125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.503125Z digest=sha256:400427bc1428fb89e9aef14d36cf29de4ad8bbda6b53a4e202026a1ad150dd59

Observation a4f97168-a213-4f81-b3c9-2d302dc6a4ad · outbound

This paper cites Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.525409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.525409Z digest=sha256:d3d7cfd7a59bb6e20934aa095a80b44403e66d2d3b2138ad84e40433d92c8f4b

Observation cf41f148-c6c9-49c2-8ced-fc8de2eb4132 · outbound

This paper cites An empirical study of catastrophic forgetting in large language models during continual fine-tuning, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning An empirical study of catastrophic forgetting in large language models during continual fine-tuning, 2025

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.549531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.549531Z digest=sha256:aca4b3961e0a0ebd7f6cb6efdb3bec6a2fe54b139dd304b65d697965719d4e95

Observation 306ca55a-8977-4c43-b068-e7ae00219c95 · outbound

This paper cites Understanding catastrophic forgetting in language models via implicit inference, 2024.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Understanding catastrophic forgetting in language models via implicit inference, 2024

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.448228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.569493Z digest=sha256:a22243002c74b57ef62162fb9ae79d87e9b0964b4286ce61ba236bc4f6e347ae

Observation 8fa6a720-8bdc-4362-8e8c-d8a6ea5fc475 · outbound

This paper cites Mitigating forgetting in llm supervised fine-tuning and preference learning, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Mitigating forgetting in llm supervised fine-tuning and preference learning, 2025

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.390818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.597604Z digest=sha256:a30c1593af894dbfe8faf238baf324c7108da2f70f38e82184a5cc563e227e23

Observation 7760956e-231c-420d-9098-dd4431ee79b7 · outbound

This paper cites A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.329093Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.612392Z digest=sha256:28f61eb9c3d9ca2b1c023ba703c544290eb1e0bee58dfdca305e0bda5a8fb5fa

Observation c994f4fb-60e2-4653-a303-8b40efe3183d · outbound

This paper cites Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification, 2025

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.276059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.639324Z digest=sha256:ed8e92ee144895e52fb07e824985b7bac815724806e406d308f56aa1a2e40447

Observation f531e55b-b3be-4cf7-a260-6a016059b088 · outbound

This paper cites Rlhf workflow: From reward modeling to online rlhf, 2024.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Rlhf workflow: From reward modeling to online rlhf, 2024

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.659964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.659964Z digest=sha256:964f93fdee8f4f2879144ac10941fdfad19c5eca4df3b49946812ce85e9ae48a

Observation 7fb36c3a-5c5a-4138-b997-813bbe4ba6ef · outbound

This paper cites Crowder, Darrien M.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Crowder, Darrien M

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.220507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.678865Z digest=sha256:72e3426fb84da64c130829ad90d5031db26df4a8e8afba5bedf9d90f53196f7d

Observation b572a305-ed7f-472d-8378-deeb0e62d57e · outbound

This paper cites Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.696541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.696541Z digest=sha256:4dd65bb83fde453a12730249d1def1ed5b9135f1bd113d39a416cdf64f4b314c

Observation f13cb632-7ea4-4904-b1d0-f366d20484a3 · outbound

This paper cites an unresolved cited work.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.714451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.714451Z digest=sha256:f3790580959d951ea1fdbdab0e6ff13709b32756c70e1b4170c006a2572d7476

Observation d2ca067d-23e6-4fbe-8ca9-5a00079695ab · outbound

This paper cites Qwen3 technical report, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Qwen3 technical report, 2025

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.160449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.744487Z digest=sha256:0132a684a6b4d869b3ef56e059bffd2f84071772c2197114c00bc05bc87d0db5

Observation 7c5fd51e-0392-4108-80d5-b889e39e837d · outbound

This paper cites Training verifiers to solve math word problems, 2021.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Training verifiers to solve math word problems, 2021

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.769727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.769727Z digest=sha256:48d298aa104dfe30381248393e96316c4aa0cb73a28d224f2a24546a41fb44db

Observation 2d5c1627-49cc-48f1-b045-a3fb593e2a90 · outbound

This paper cites Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.797022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.797022Z digest=sha256:1d64252c47067d8701e388e93426c4a68c0a59f8db3bc3986e71a0157b317368

Observation 434d5553-358d-418f-bc3a-f4b96d842bf7 · outbound

This paper cites Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models, 2023.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models, 2023

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.817483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.817483Z digest=sha256:76c06f7adaba9f4e82c7a51b55bdcdfbf1e34d614286d438db57373859c92459

Observation cffc18b3-eda4-484a-b3b8-37a3de341bae · outbound

This paper cites Limo: Less is more for reasoning, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Limo: Less is more for reasoning, 2025

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.834330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.834330Z digest=sha256:c1030d15765e10ef877647d37ba0fbf974d48afc9a9591118e8cb2c4f1cf86d0

Observation a69a6886-5641-4d42-a851-a7db21a2cc25 · outbound

This paper cites Hitab: A hierarchical table dataset for question answering and natural language generation, 2022.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Hitab: A hierarchical table dataset for question answering and natural language generation, 2022

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.073692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.864678Z digest=sha256:09f1ee55e8bbac72574448e633ed1ea10fbf8fb44a3f7175ed72a77f2940624b

Observation d6d5564e-2666-4335-8238-642123a62d77 · outbound

This paper cites Let’s think step by step and output the final answer in boxed{}.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Let’s think step by step and output the final answer in boxed{}

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.023395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T11:55:03.887091Z digest=sha256:309aed501fc050c13330a9d13666e6739b8c8353de3e7ee6d64a9fa306b5962a

Pith citing papers

Observation 90be6e53-f651-415a-b8a1-e2b32ae7e8e1 · inbound

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization cites this paper.

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-19T01:16:56.964027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-19T01:15:49.658412Z digest=sha256:54f2c582bb4704fc08a67f1087c94e4779e1c47c5ef2b43097bed59239bcabd8

Observation 610758d7-d080-41fe-9881-233359ab642e · inbound

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle cites this paper.

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 110

Resolution
unresolved
no resolver link, observed 2026-08-04T16:07:35.392271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:07:35.392271Z digest=sha256:5e2a402b3119f354df8b5e79157719022885a702b50fccb3b095338aa1c58492

Observation a2667e53-be8e-46f9-981c-14079b6fe28c · inbound

Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO cites this paper.

Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T04:22:10.295612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T04:22:10.295612Z digest=sha256:f55fc09a7e91bf9957695123c96653cabc1810d609488ca72a4c301d048af9f1

Observation 57240f1c-a150-40d6-ae3d-47b02cb56f43 · inbound

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning cites this paper.

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-11T21:06:14.394139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-08T06:44:34.968571Z digest=sha256:4288ca5c8daeeff471cf703f05a3d3cd6ffb05001edd0851006f3a488dddbe39

Observation cd5e782a-7809-47d7-a165-0c67046e81f1 · inbound

Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance cites this paper.

Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-15T03:19:43.113819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T03:18:26.590871Z digest=sha256:86d79842ef85909259e4df9f9d21463f9b5b89c484a3dccc218bcef4afc172da

Observation f2aca1d8-0c27-43b2-9113-1b2e1dc0225e · inbound

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff cites this paper.

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-07-02T22:27:26.464680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T18:49:47.876179Z digest=sha256:ba2d204c9d29b6a5134c79f11ccc3f7bb43d524c20a88f59f4e809cfe3260e0a

Observation 92ee178a-556f-4350-8c19-7bb3efef8f13 · inbound

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning cites this paper.

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 141

Resolution
verified exact
arxiv_id, observed 2026-07-03T20:38:56.058157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T01:13:11.483599Z digest=sha256:85f1050b83a179216f7dd6be7989ab9858fd92c29b1f5452753a7d1dd9f752cc

Observation 5323e6c5-86e5-44d6-a07b-b521c3fe5daa · inbound

AIR: Adaptive Interleaved Reasoning with Code in MLLMs cites this paper.

AIR: Adaptive Interleaved Reasoning with Code in MLLMs SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T10:09:44.997118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-26T09:06:38.001604Z digest=sha256:88126db9a9e6db0ebb097a0555a37117a37f23922ad048e2b65960a865088117