Pith. sign in

Paper Citation Record · LEDGER

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion

As of 22 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.20543.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.20543 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T07:14:53.084480Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

23 of 23 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved23
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d4a1d0e2-fa81-418a-a580-9e9cd53aefda · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:52.962418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:52.962418Z digest=sha256:8225f18864396aa7a0acc74cb5aca6f32dd98ba278fa0704affae743ee7c11a4

Observation ab93d74a-9181-4856-9c4d-24c6a3300412 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Evaluating Large Language Models Trained on Code

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:52.968359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:52.968359Z digest=sha256:b5ddcba0959d75b776beda5ba3a57e8d79ec3985fd093eacdc853b6ce1072783

Observation bacf7d46-6f06-4ecf-8be7-69c1a5f7eb4d · outbound

This paper cites The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:52.974227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:52.974227Z digest=sha256:de772e4f184b9e07ff4680da624b79e305acb4ad79a4f951a6dac256a6c6e115

Observation c4263efc-e780-4a88-91e7-e55119155782 · outbound

This paper cites Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:52.979212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:52.979212Z digest=sha256:f04e3db0111e15e32d808988851f5f49dab42842d09de366c1f78fbe82ce8c1e

Observation f381000e-02f5-4e38-8cfe-d9ce89303776 · outbound

This paper cites Soft actor- critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Soft actor- critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:52.984929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:52.984929Z digest=sha256:71774fbffd4b347162fad377563c965bb030b4e83a9909a52df1d49556a3a927

Observation 4adbbb55-7d08-476c-bbd5-bc638c57dcb5 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Measuring Mathematical Problem Solving With the MATH Dataset

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:52.991147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:52.991147Z digest=sha256:45b0b2fec987794a68cdd78063ec0020d20e8616d60fccb176d7e8fd6a7568c0

Observation c438dce3-e397-4c15-a545-0243ad685036 · outbound

This paper cites REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:52.997903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:52.997903Z digest=sha256:3f930308143a4d52263546e6681040468842ae48b187da1fc89323f0d9a924f3

Observation 4d2689a0-509a-4c1f-98de-03ca1e3d9ba6 · outbound

This paper cites Reinforcement learning with KL penalties is better viewed as Bayesian inference.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Reinforcement learning with KL penalties is better viewed as Bayesian inference

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.003685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.003685Z digest=sha256:02077d35a2bd94e722613298c212e0b0c318239952e370cb93fc53ed1413182e

Observation c9b5b5ab-3351-4b8e-8e77-36f226585886 · outbound

This paper cites Conservative Q- learning for offline reinforcement learning.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Conservative Q- learning for offline reinforcement learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.008634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.008634Z digest=sha256:3687096acea61566652e403d6016302cca5d6beed7612d0bd0654a7e8686e0be

Observation 21403e57-5303-457e-920f-67a325d5f2b3 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.014639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.014639Z digest=sha256:ec69cb1c9b20d00966bf60be5a29227566229269f494da690ee09c271ee8b661

Observation caa5c229-72ee-42f7-9314-b035d470078f · outbound

This paper cites ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.020270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.020270Z digest=sha256:ded8f8b22291f1a10bedb6e076cccf0976285299eae10e00800b26ea88856dd4

Observation 5a284f46-fa53-43e6-a885-84592237f648 · outbound

This paper cites Let's Verify Step by Step.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Let's Verify Step by Step

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.025574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.025574Z digest=sha256:32ba2b22a966e3049a9babb8ae3a8bc4d94c57addb62a779d2605f09f5078aad

Observation 4df64507-abac-4e22-a073-fc1f704e22fb · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Understanding R1-Zero-Like Training: A Critical Perspective

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.031461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.031461Z digest=sha256:3ffc2f5ae9ea3064c15249aeeeff99f2a560732419cd8d7739d3416ac72e87d8

Observation 5dc83e24-01f4-4a0b-802b-6a0595fbe205 · outbound

This paper cites Manning, and Chelsea Finn.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Manning, and Chelsea Finn

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.037122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.037122Z digest=sha256:f3882585814c20ab9aad255b581ee3ffdecf63f7b29180e8085838737377175e

Observation 86fb70e2-15d2-4099-ac17-d04c00ab3f38 · outbound

This paper cites Vanishing gradients in reinforcement finetuning.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Vanishing gradients in reinforcement finetuning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.041847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.041847Z digest=sha256:253736fdcc29892d8b1e3d4d0fa9eaab5166e14d1dfdebb434dac6ebfb1a1538

Observation 7f1678a4-98ae-45fc-babc-2415442f5739 · outbound

This paper cites Proximal Policy Optimization Algorithms.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Proximal Policy Optimization Algorithms

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.046758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.046758Z digest=sha256:32d55cd8774671500604a6d0476386bf70236d3e5a50face9d688d00a184f8d6

Observation ea90215b-1e69-4660-a087-aa37df089232 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.052186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.052186Z digest=sha256:8a425bc39ee75fa01ac9c6e1a9f71a85bb084e45eb7bf9089eed34dbdf8a1678

Observation a47a8065-aa39-41cf-b2de-f2fa2ed0dc2d · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion HybridFlow: A Flexible and Efficient RLHF Framework

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.058307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.058307Z digest=sha256:869cb1fc5296b1090be7874452667a3f01f5e6b0f4a74c1dad65f89525dbe24a

Observation 968ff127-977e-4155-87ca-a1faf74458a4 · outbound

This paper cites Qwen2.5 Technical Report.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Qwen2.5 Technical Report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.063364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.063364Z digest=sha256:8300006eb69eb1b2f287e846fb2751ce3491e73d3a18bcff9a1f80c9029ba679

Observation 91e01598-9ac0-470e-b5e6-3681d2c157b6 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.068293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.068293Z digest=sha256:9b02a6e8ca089f930bd41ddd3b1cea6cde16d4b248ad275bfe5e180e702400cd

Observation a0b8fd97-5e54-4efc-9280-b1c8ed3769a4 · outbound

This paper cites Understanding diversity collapse in RLVR via the lens of over- training.arXiv:2606.15455, 2026.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Understanding diversity collapse in RLVR via the lens of over- training.arXiv:2606.15455, 2026

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.074193Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.074193Z digest=sha256:ff3b8710107231af07aec64f6a675b3dbfcc3dd6eb1202f8d590357a985e9577

Observation b25c59c6-96e1-4bca-b08a-cfe6eda755dc · outbound

This paper cites Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.079341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.079341Z digest=sha256:24d103da5c1a2f8baf6666dec907104c6914f789d6c9683b914a59fa39c1f140

Observation fa86c831-0274-4832-9eba-19bc8f4e8c0e · outbound

This paper cites Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining.

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T07:14:53.084480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:14:53.084480Z digest=sha256:c79b62b91455ac23bbeb05bba6984b9b5f9c8e89ff3752b0b21c8ea75ccc4886

Pith citing papers

No inbound Pith citation observations are available.