{"as_of":"2026-08-22T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf43eba564c2fa8fec8adba36af891b5b1490e62efc3806e20956bdb16c1e884","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:14:53.084480Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20543/citation-record","integrity":"/paper/2607.20543/integrity","json":"/paper/2607.20543/citation-record.json","paper":"/paper/2607.20543"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-02T07:14:52.962418Z","title":"Back to basics: Revisiting REINFORCE style optimization for learning from human feedback in LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.962418Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:8225f18864396aa7a0acc74cb5aca6f32dd98ba278fa0704affae743ee7c11a4","observation_id":"d4a1d0e2-fa81-418a-a580-9e9cd53aefda","resolution":{"observed_at":"2026-08-02T07:14:52.962418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-02T07:14:52.968359Z","title":"Evaluating large language models trained on code.arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.968359Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:b5ddcba0959d75b776beda5ba3a57e8d79ec3985fd093eacdc853b6ce1072783","observation_id":"ab93d74a-9181-4856-9c4d-24c6a3300412","resolution":{"observed_at":"2026-08-02T07:14:52.968359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-02T07:14:52.974227Z","title":"The entropy mechanism of reinforcement learning for reasoning models.arXiv:2505.22617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.974227Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:de772e4f184b9e07ff4680da624b79e305acb4ad79a4f951a6dac256a6c6e115","observation_id":"bacf7d46-6f06-4ecf-8be7-69c1a5f7eb4d","resolution":{"observed_at":"2026-08-02T07:14:52.974227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-02T07:14:52.979212Z","title":"Omni-MATH: A universal olympiad level mathematic benchmark for large language models.arXiv:2410.07985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.979212Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:f04e3db0111e15e32d808988851f5f49dab42842d09de366c1f78fbe82ce8c1e","observation_id":"c4263efc-e780-4a88-91e7-e55119155782","resolution":{"observed_at":"2026-08-02T07:14:52.979212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:14:52.984929Z","title":"Soft actor- critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.984929Z"},"links":{"citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:71774fbffd4b347162fad377563c965bb030b4e83a9909a52df1d49556a3a927","observation_id":"f381000e-02f5-4e38-8cfe-d9ce89303776","resolution":{"observed_at":"2026-08-02T07:14:52.984929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-02T07:14:52.991147Z","title":"Measuring mathematical problem solving with the MATH dataset.arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.991147Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:45b0b2fec987794a68cdd78063ec0020d20e8616d60fccb176d7e8fd6a7568c0","observation_id":"4adbbb55-7d08-476c-bbd5-bc638c57dcb5","resolution":{"observed_at":"2026-08-02T07:14:52.991147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-02T07:14:52.997903Z","title":"REINFORCE++: A simple and efficient approach for aligning large language models.arXiv:2501.03262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.997903Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:3f930308143a4d52263546e6681040468842ae48b187da1fc89323f0d9a924f3","observation_id":"c438dce3-e397-4c15-a545-0243ad685036","resolution":{"observed_at":"2026-08-02T07:14:52.997903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:14:53.003685Z","title":"Reinforcement learning with KL penalties is better viewed as Bayesian inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.003685Z"},"links":{"citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:02077d35a2bd94e722613298c212e0b0c318239952e370cb93fc53ed1413182e","observation_id":"4d2689a0-509a-4c1f-98de-03ca1e3d9ba6","resolution":{"observed_at":"2026-08-02T07:14:53.003685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:14:53.008634Z","title":"Conservative Q- learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.008634Z"},"links":{"citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:3687096acea61566652e403d6016302cca5d6beed7612d0bd0654a7e8686e0be","observation_id":"c9b5b5ab-3351-4b8e-8e77-36f226585886","resolution":{"observed_at":"2026-08-02T07:14:53.008634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-02T07:14:53.014639Z","title":"Tulu 3: Pushing frontiers in open language model post- training.arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.014639Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:ec69cb1c9b20d00966bf60be5a29227566229269f494da690ee09c271ee8b661","observation_id":"21403e57-5303-457e-920f-67a325d5f2b3","resolution":{"observed_at":"2026-08-02T07:14:53.014639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-19T17:31:23.637137Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-02T07:14:53.020270Z","title":"ReMax: A simple, effective, and efficient reinforcement learning method for aligning large language models.arXiv:2310.10505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.020270Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:ded8f8b22291f1a10bedb6e076cccf0976285299eae10e00800b26ea88856dd4","observation_id":"caa5c229-72ee-42f7-9314-b035d470078f","resolution":{"observed_at":"2026-08-02T07:14:53.020270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-02T07:14:53.025574Z","title":"Let’s verify step by step.arXiv:2305.20050, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.025574Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:32ba2b22a966e3049a9babb8ae3a8bc4d94c57addb62a779d2605f09f5078aad","observation_id":"5a284f46-fa53-43e6-a885-84592237f648","resolution":{"observed_at":"2026-08-02T07:14:53.025574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-02T07:14:53.031461Z","title":"Understanding R1-Zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.031461Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:3ffc2f5ae9ea3064c15249aeeeff99f2a560732419cd8d7739d3416ac72e87d8","observation_id":"4df64507-abac-4e22-a073-fc1f704e22fb","resolution":{"observed_at":"2026-08-02T07:14:53.031461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:14:53.037122Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.037122Z"},"links":{"citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:f3882585814c20ab9aad255b581ee3ffdecf63f7b29180e8085838737377175e","observation_id":"5dc83e24-01f4-4a0b-802b-6a0595fbe205","resolution":{"observed_at":"2026-08-02T07:14:53.037122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:14:53.041847Z","title":"Vanishing gradients in reinforcement finetuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.041847Z"},"links":{"citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:253736fdcc29892d8b1e3d4d0fa9eaab5166e14d1dfdebb434dac6ebfb1a1538","observation_id":"86fb70e2-15d2-4099-ac17-d04c00ab3f38","resolution":{"observed_at":"2026-08-02T07:14:53.041847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T07:14:53.046758Z","title":"Proximal policy optimization algorithms.arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.046758Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:32d55cd8774671500604a6d0476386bf70236d3e5a50face9d688d00a184f8d6","observation_id":"7f1678a4-98ae-45fc-babc-2415442f5739","resolution":{"observed_at":"2026-08-02T07:14:53.046758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T07:14:53.052186Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models.arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.052186Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:8a425bc39ee75fa01ac9c6e1a9f71a85bb084e45eb7bf9089eed34dbdf8a1678","observation_id":"ea90215b-1e69-4660-a087-aa37df089232","resolution":{"observed_at":"2026-08-02T07:14:53.052186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-02T07:14:53.058307Z","title":"HybridFlow: A flexible and efficient RLHF framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.058307Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:869cb1fc5296b1090be7874452667a3f01f5e6b0f4a74c1dad65f89525dbe24a","observation_id":"a47a8065-aa39-41cf-b2de-f2fa2ed0dc2d","resolution":{"observed_at":"2026-08-02T07:14:53.058307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T07:14:53.063364Z","title":"Qwen2.5 technical report.arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.063364Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:8300006eb69eb1b2f287e846fb2751ce3491e73d3a18bcff9a1f80c9029ba679","observation_id":"968ff127-977e-4155-87ca-a1faf74458a4","resolution":{"observed_at":"2026-08-02T07:14:53.063364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T07:14:53.068293Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.068293Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:9b02a6e8ca089f930bd41ddd3b1cea6cde16d4b248ad275bfe5e180e702400cd","observation_id":"91e01598-9ac0-470e-b5e6-3681d2c157b6","resolution":{"observed_at":"2026-08-02T07:14:53.068293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:14:53.074193Z","title":"Understanding diversity collapse in RLVR via the lens of over- training.arXiv:2606.15455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.074193Z"},"links":{"citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:ff3b8710107231af07aec64f6a675b3dbfcc3dd6eb1202f8d590357a985e9577","observation_id":"a0b8fd97-5e54-4efc-9280-b1c8ed3769a4","resolution":{"observed_at":"2026-08-02T07:14:53.074193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-02T07:14:53.079341Z","title":"Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model?arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.079341Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:24d103da5c1a2f8baf6666dec907104c6914f789d6c9683b914a59fa39c1f140","observation_id":"b25c59c6-96e1-4bca-b08a-cfe6eda755dc","resolution":{"observed_at":"2026-08-02T07:14:53.079341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-21T11:31:21.981576Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-02T07:14:53.084480Z","title":"Echo chamber: RL post-training amplifies behaviors learned in pretraining.arXiv:2504.07912, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.084480Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:c79b62b91455ac23bbeb05bba6984b9b5f9c8e89ff3752b0b21c8ea75ccc4886","observation_id":"fa86c831-0274-4832-9eba-19bc8f4e8c0e","resolution":{"observed_at":"2026-08-02T07:14:53.084480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T21:58:28.023029Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.20543."}