{"as_of":"2026-08-13T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea2305c2b48127efb9ce259d33b8b33e7c2f86c06d84dfb89a8bf65c5f1648f6","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:56:18.716371Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:06:50.901959Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T08:04:29.012591Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"cited_work":{"arxiv_id":"2505.17218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17218","snapshot_observed_at":"2026-06-30T08:04:29.012591Z","title":"2505.17218 , archivePrefix=","venue":null,"work_id":"fb23ba4f-7d18-468d-b6a4-4efeef859228","year":null},"citing_paper":{"arxiv_id":"2606.29758","last_updated":"2026-07-27T10:44:50Z","snapshot_observed_at":"2026-08-02T09:40:36.275703Z","submitted_at":"2026-06-29T04:04:32Z","title":"PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-30T07:36:39.835616Z"},"links":{"cited_paper":"/paper/2505.17218","citing_paper":"/paper/2606.29758"},"observation_digest":"sha256:629ae639df54638929ca2600a3ba18448c29575c24f85643a95c01affe76a432","observation_id":"994ae51c-3fec-4000-86d4-ddd81495384d","resolution":{"observed_at":"2026-06-30T08:04:29.013956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17218","snapshot_observed_at":"2026-08-01T12:06:50.901959Z","title":"Effective reinforcement learning for reasoning in language models.arXiv preprint arXiv:2505.17218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.901959Z"},"links":{"cited_paper":"/paper/2505.17218","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:09b41a6f11d37f285d3b11baef3773911de7a5914ac38d0650c9a7e32461430b","observation_id":"c7e51b63-acdb-44de-a9fd-2741712cc433","resolution":{"observed_at":"2026-08-01T12:06:50.901959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17218/citation-record","integrity":"/paper/2505.17218/integrity","json":"/paper/2505.17218/citation-record.json","paper":"/paper/2505.17218"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:14.897391Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:14.897391Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:c51b1564e5d985fec2f27a5c410862ebc53bb82298dfa8d77a25a336558542d4","observation_id":"f2fa5f58-4f1f-4daf-b021-5e534733bb6f","resolution":{"observed_at":"2026-08-07T14:56:14.897391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:14.982183Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:14.982183Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:8f8c06e163b8fa951bccd301d5b62db61c10c4b6e8b23aea1b6df8364a32ec9b","observation_id":"97841ca2-85be-437f-b2a4-1f9298a55adc","resolution":{"observed_at":"2026-08-07T14:56:14.982183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T14:56:15.099420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:15.099420Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:3dd024f732b0f1b4cb570da5df065b24b041855e518056fa2c4df7a83d0a83f8","observation_id":"8e0692bc-14ce-48d8-b019-878a3bfab9f4","resolution":{"observed_at":"2026-08-07T14:56:15.099420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T14:56:15.184375Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:15.184375Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:f101fff5aafbcb4d1a227be17ae7753fc1f1418fc9f21ee5ca51a424ffe57fcc","observation_id":"301d928e-21e4-4ad1-be3a-a639961f7515","resolution":{"observed_at":"2026-08-07T14:56:15.184375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:15.274117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:15.274117Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:00a21fc83889d023c61fc0eaee1fdccffb83882e73636273a0e1b2cc938feccc","observation_id":"81179bea-7776-4a74-bbd2-e377439404e0","resolution":{"observed_at":"2026-08-07T14:56:15.274117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-13T05:53:40.193848Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-07T14:56:15.384955Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:15.384955Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:4a618298fd24c39144fa7fa5af18d4aff0b060fa90ddd24c487aef1d43f82709","observation_id":"3a52da57-1d21-4abd-889f-50538f316495","resolution":{"observed_at":"2026-08-07T14:56:15.384955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:56:15.576588Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:15.576588Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:220282b5a314da9c2c25e5ab508ac0d7e32c51487ad92218ad97c1827353086a","observation_id":"f7537b4e-1f81-47a5-bbc7-9a03136413ba","resolution":{"observed_at":"2026-08-07T14:56:15.576588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:56:15.755879Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:15.755879Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:87f009c34457375b7e809912edc0906f5f9634be32314f7d6a8b4afa05ba4ded","observation_id":"39563835-0abf-4359-9613-2f588b7937b3","resolution":{"observed_at":"2026-08-07T14:56:15.755879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:56:15.955208Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:15.955208Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:4502d3a9ba4e5466efebc5aac8e4dcc09b5fdebec89dccfdd0307d5850603c9e","observation_id":"f966a498-ec37-4cf1-9e01-3eccea43e577","resolution":{"observed_at":"2026-08-07T14:56:15.955208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:56:16.075367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.075367Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:5e0318a2f7d6986f45f0bd59e2f1282029457f1ff3b9972ec57d85689e98fb2a","observation_id":"5c1df620-03e1-4f3e-8d84-d1bd9aef3e45","resolution":{"observed_at":"2026-08-07T14:56:16.075367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-07T14:56:16.257566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.257566Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:351377aa3dba419eb08b58288ebbb8444f5b0367a463ec0b5e978b4f3beff752","observation_id":"c0f4e25b-0026-4598-9290-4d4737d2310e","resolution":{"observed_at":"2026-08-07T14:56:16.257566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T14:56:16.401585Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.401585Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:18a3c2dcb43b7a4ef5e0f7cc427457f4d4570b578e76b22cb09b2aa16a6b7b3c","observation_id":"050c12db-bcab-42ea-804c-9a2547a3080e","resolution":{"observed_at":"2026-08-07T14:56:16.401585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T14:56:16.492420Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.492420Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:519cb65e548b8da9cf8abb31533d0ff20f4433c1ed4048784a00abc25d56db49","observation_id":"6eccfac8-72d1-48ae-a614-79ee08b6f4d0","resolution":{"observed_at":"2026-08-07T14:56:16.492420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-08-13T01:03:17.197258Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-07T14:56:16.588380Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.588380Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:80b4d184681500b2c6ca1af68eb83ab6faa39cc5230ddbf340a92ed081ddb26a","observation_id":"36ce54ae-9fc4-43f3-b569-e7d0796fb5b8","resolution":{"observed_at":"2026-08-07T14:56:16.588380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-12T22:32:25.074756Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T14:56:16.694006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.694006Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:5132e6546cc426000789e4ced55821d34e495d6a8975f435320fad17e10579ec","observation_id":"63b5de8a-0e45-4078-b03c-0c1fcbee1a0e","resolution":{"observed_at":"2026-08-07T14:56:16.694006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-07T14:56:16.814005Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.814005Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:ffd7d894a83c76ccf7692fc248d254840c3140df109184fdc729e24b259881a0","observation_id":"7b12b335-90f4-4257-9d3f-91771ac5fa9d","resolution":{"observed_at":"2026-08-07T14:56:16.814005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:16.939493Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.939493Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:772769662e7daa4f20ef6e2cdac8fb2a69dbe1fdefe420dd006f460cfb84f5be","observation_id":"733bbca4-b1e2-4ed9-8c6a-204e78ee2a8f","resolution":{"observed_at":"2026-08-07T14:56:16.939493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07670","last_updated":"2022-09-16T01:47:36Z","snapshot_observed_at":"2026-08-13T14:25:24.981413Z","submitted_at":"2022-09-16T01:47:36Z","title":"Reducing Variance in Temporal-Difference Value Estimation via Ensemble of Deep Networks","version":1},"cited_work":{"arxiv_id":"2209.07670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.07670","snapshot_observed_at":"2026-08-07T14:56:19.148780Z","title":"Reducing Variance in Temporal-Difference Value Estimation via Ensemble of Deep Networks","venue":"cs.LG","work_id":"0b61c945-949f-4a06-9061-6e435c907612","year":2022},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.028265Z"},"links":{"cited_paper":"/paper/2209.07670","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:7f177e28bca7cde6400299a91e9a28724f4238ba9a89daa874690e5f95540238","observation_id":"e517c5bc-b108-4c77-9ac9-9608e45ca82c","resolution":{"observed_at":"2026-08-07T14:56:19.192058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T14:56:17.083444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.083444Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:d6da6e4590e1fb4f68f47b47307355f1608b72da19c0a601d9b68c353285b2b9","observation_id":"270e01a2-50f5-47df-a1bd-76d15e791718","resolution":{"observed_at":"2026-08-07T14:56:17.083444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:17.162071Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.162071Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:14b2958390d03a5f64a10cccb3c8ec8f588d372cfbfbb1851e911775804e7ac2","observation_id":"042a3e37-ed0d-4921-8777-21f179c4531d","resolution":{"observed_at":"2026-08-07T14:56:17.162071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:56:17.239533Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.239533Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:1ced880921bba6d292bb54d4f8ded28e1ac1fe7e32a48a4792c51458e02271b0","observation_id":"4e601eb6-26b0-4b54-bddb-8822e369e2dd","resolution":{"observed_at":"2026-08-07T14:56:17.239533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:56:17.321965Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.321965Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:7f62a8c735430f309220d469c968c9179fb4315438554086c2fd9e78f0fc5893","observation_id":"814140a9-8ba0-4f56-bf05-c33cc0f80a66","resolution":{"observed_at":"2026-08-07T14:56:17.321965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05635","last_updated":"2018-06-14T16:25:55Z","snapshot_observed_at":"2026-08-10T18:52:30.985274Z","submitted_at":"2018-06-14T16:25:55Z","title":"Self-Imitation Learning","version":1},"cited_work":{"arxiv_id":"1806.05635","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.05635","snapshot_observed_at":"2026-08-07T14:56:18.989655Z","title":"Self-Imitation Learning","venue":"cs.LG","work_id":"fe226f8c-428b-4803-bc22-6d2315e729d7","year":2018},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.392954Z"},"links":{"cited_paper":"/paper/1806.05635","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:71c8a7e1f7d7d1cea6d3a30e28a719a3295d0958ef288c906db5249831dce861","observation_id":"43182d4f-8861-4cee-83b8-1500f8c0036a","resolution":{"observed_at":"2026-08-07T14:56:19.033963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:17.461424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.461424Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:785a198edfa65bb394247ffb4e0d36d0e72f250ab7f1f5e27830e825bc702506","observation_id":"3f68f129-c728-4c2e-a650-2d86c599d465","resolution":{"observed_at":"2026-08-07T14:56:17.461424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12655","last_updated":"2021-08-29T19:43:43Z","snapshot_observed_at":"2026-08-06T05:51:42.612813Z","submitted_at":"2021-05-25T00:13:29Z","title":"CodeNet: A Large-Scale AI for Code Dataset for Learning a Diversity of Coding Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.12655","snapshot_observed_at":"2026-08-07T14:56:17.548731Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.548731Z"},"links":{"cited_paper":"/paper/2105.12655","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:ac568e1c5ff207bab4a7b08b7b2ce0e41325cd2ed822ee27ee4c4b993c2664fe","observation_id":"545294a5-5926-460a-b977-543dba9b152a","resolution":{"observed_at":"2026-08-07T14:56:17.548731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:56:17.628210Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.628210Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:c15781c9092f3b9e13f683f12b563914c2f20637e1b8c8e689c534053d99e887","observation_id":"780eb4ef-b32b-40c1-95a6-d78ffba76438","resolution":{"observed_at":"2026-08-07T14:56:17.628210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-07T14:56:17.692371Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.692371Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:9d516aea524a7f062f3b218c70bd5f99ed7c45d5909246ea6018bcf4903d069b","observation_id":"8e56e107-4a44-4340-ba18-a94071a5042e","resolution":{"observed_at":"2026-08-07T14:56:17.692371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-07T14:56:17.748538Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.748538Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:507d8b4197af65ef29d26f1ed42fdc70410ad55e47cfa8418acd5b0b664546a8","observation_id":"639f44f9-78aa-41e0-aa57-6ad4818c4c78","resolution":{"observed_at":"2026-08-07T14:56:17.748538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:56:17.830451Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.830451Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:5c8af88a00c1735d86d3ad0219e7001555b2fa48d7f49b1f707a51491d8ee328","observation_id":"2dfa1d65-2157-41e4-9722-60757a500681","resolution":{"observed_at":"2026-08-07T14:56:17.830451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:56:17.886290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.886290Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:ab01a673f36cc77869fead2f2959fb8354e38904a3386f1290c295beb687e83c","observation_id":"ac161ae9-b028-48b7-a580-d042a309d5dd","resolution":{"observed_at":"2026-08-07T14:56:17.886290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-10T17:44:16.302071Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-07T14:56:17.978553Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:17.978553Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:f727d157095f11b3bd392849cf1b4afd9e1fc536aa8e9398e311baf077a9421b","observation_id":"4a691dc3-28f2-4255-be38-cd450d3a1558","resolution":{"observed_at":"2026-08-07T14:56:17.978553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:18.023760Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.023760Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:1a713cdb57d427e6733a2a8257db053b181cf19275a500ebc5c3373ff4f54065","observation_id":"7cbbb8d0-7fd2-4f2a-b8aa-45c296fd114c","resolution":{"observed_at":"2026-08-07T14:56:18.023760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:18.097191Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.097191Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:9d305a5df03859c264900ad948b0d2aaea1436318d117295e002718a7cfc77ec","observation_id":"5a2659db-8d4f-42df-ae76-e81e7824c3df","resolution":{"observed_at":"2026-08-07T14:56:18.097191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:19.364773Z","title":null,"venue":null,"work_id":"80bff779-c8dd-44ad-ab4d-90c99e41b264","year":1999},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.186529Z"},"links":{"citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:4165e4956acbdbe3d72d819a907f0178b1b78939fac9b8599418bd68ca4e5cb2","observation_id":"6da98b5e-23a4-40ed-b66b-21c67f6ce3bd","resolution":{"observed_at":"2026-08-07T14:56:19.435126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T14:56:18.266807Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.266807Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:101ed08c5b161bc565a1e6b6105f994e8c0306272707f2d3ce13c14f8f4e1182","observation_id":"9fbd850b-24ad-4320-b377-21e8ef4a88a9","resolution":{"observed_at":"2026-08-07T14:56:18.266807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T14:56:18.335444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.335444Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:5fffb3234f20028874ac68e29cbb953f35c68cfbc0a6a10bdec5ae1ab9c98fef","observation_id":"c16523a4-1438-4de7-833b-e12e8e102578","resolution":{"observed_at":"2026-08-07T14:56:18.335444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00047","last_updated":"2025-09-13T00:52:27Z","snapshot_observed_at":"2026-08-07T15:57:56.979770Z","submitted_at":"2025-04-30T03:41:55Z","title":"Base Models Beat Aligned Models at Randomness and Creativity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00047","snapshot_observed_at":"2026-08-07T14:56:18.386633Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.386633Z"},"links":{"cited_paper":"/paper/2505.00047","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:ffb65e5d8863662ef1805d7b6acd0af4753aec9f2949f44c2ce293aaa29ba04a","observation_id":"fe47ffdc-66f5-4879-8e9c-6fde23034d61","resolution":{"observed_at":"2026-08-07T14:56:18.386633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T14:56:18.475326Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.475326Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:45ccadd8963b39c140d84a15f080598a7ece3bdd621fa90d90379bd0db9a5d64","observation_id":"fd47ed01-d16f-429a-a201-48e1db98f6d8","resolution":{"observed_at":"2026-08-07T14:56:18.475326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T14:56:18.537200Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.537200Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:a749f96fba2460dfc8c556d80ca4d95cc109e7a33f28acb9e1e96724386128ca","observation_id":"26c10c2e-0fc2-438c-8532-43fa80c9e67c","resolution":{"observed_at":"2026-08-07T14:56:18.537200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-13T05:45:19.606713Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-07T14:56:18.612262Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.612262Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:c92f48d2173b6d1c7c2c605680ca04914ffc2c598ef179eb749abd901d022ad9","observation_id":"4eca98ce-8d50-4895-9a5f-eb59a07aa06b","resolution":{"observed_at":"2026-08-07T14:56:18.612262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T14:56:18.716371Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:18.716371Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:e06168746a7658a49cfe4c3cdc1523514d905de55c260bea69366441e68e645e","observation_id":"25824708-5506-4a7e-bee0-b07e9bc130f3","resolution":{"observed_at":"2026-08-07T14:56:18.716371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2505.17218."}