{"as_of":"2026-08-08T13:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41102d5de574d6ece4eaa82bab833da979dae440357c7d9c26f52e47ccd304f4","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:33:58.345391Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:22:11.829438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:47:59.849796Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:5e3b4b1cae79170634699232c9d6b52aaa3faaead28ea4f7082f1770ff3f35b0","observation_id":"b4d40336-1471-4269-b24f-77da40690d0f","resolution":{"observed_at":"2026-05-18T19:21:48.638499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2604.06804","last_updated":"2026-04-08T08:17:25Z","snapshot_observed_at":"2026-08-02T18:54:27.178723Z","submitted_at":"2026-04-08T08:17:25Z","title":"LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:04.225059Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2604.06804"},"observation_digest":"sha256:bf9b781caeefe0586a7914aa1959a41e8d9db5677647ae39a2c90b0331eb38ff","observation_id":"db8baea6-a880-4384-a29e-9fd1060a96ae","resolution":{"observed_at":"2026-05-11T07:16:02.195880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2604.16972","last_updated":"2026-04-18T11:43:08Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T11:43:08Z","title":"MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T07:05:45.081955Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2604.16972"},"observation_digest":"sha256:d8c759ab377967e73a95159bb9161f8ddbe7cd070d5091f4b370b6db26d0c196","observation_id":"332989d2-bc58-4d9e-b58b-55c974b8e2be","resolution":{"observed_at":"2026-05-10T07:06:52.840498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2604.28020","last_updated":"2026-05-29T15:07:05Z","snapshot_observed_at":"2026-07-06T23:13:24.960159Z","submitted_at":"2026-04-30T15:39:09Z","title":"Cost-Aware Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T05:11:01.131590Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2604.28020"},"observation_digest":"sha256:6a0190262d005a202eaba34b619ef69e55566c4edf063bc66f1cf93b3cc2ad91","observation_id":"3644689d-62f7-4cea-8a5c-5ec10e9c720c","resolution":{"observed_at":"2026-05-12T10:36:30.855968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:a0de8903d3a033dc074bb29c2bb56b134b8e9d5ec3ed9451ca11c11f0cff612b","observation_id":"920e3085-d9e2-44c6-a90f-4243e10ddbe6","resolution":{"observed_at":"2026-05-10T23:15:49.463309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.05802","last_updated":"2026-05-07T07:41:09Z","snapshot_observed_at":"2026-08-03T11:14:43.716738Z","submitted_at":"2026-05-07T07:41:09Z","title":"Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T15:31:23.161009Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.05802"},"observation_digest":"sha256:d6b3db365efea8619ab79dbe85c936a31186c94ffaaf8619beda34cc0dc6af3b","observation_id":"cb3b60b6-8cee-4536-9fa1-7a060ba2fb04","resolution":{"observed_at":"2026-05-11T16:41:09.059414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:543243e4a509ae53b88737c532857e4163e29e4cfa84b7ba94af05386c80206b","observation_id":"1bd91141-483c-4119-97cc-f75940b57616","resolution":{"observed_at":"2026-05-11T21:31:15.988767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:9832e79b247311ba08cfba155e615032a1581e28930a2cb59f85bae3b22978f0","observation_id":"99e4c427-1350-4aaa-bef3-db35fa1bc34b","resolution":{"observed_at":"2026-05-21T08:39:53.200705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:c9f9b8d2b454c25e8e2bd6cfb77218327b28ff01db2ecd03da26df2e8803502d","observation_id":"e8dfdb1f-37e0-4527-abcc-0816e3b30fcd","resolution":{"observed_at":"2026-05-11T03:55:56.733368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.07579","last_updated":"2026-05-11T03:09:39Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:49:36Z","title":"Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:28.113371Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.07579"},"observation_digest":"sha256:865519a54f5729d31fd74e1d65af66ee9da29176c82568c831d979b466cfb993","observation_id":"56fe42d0-5d57-4e03-8d3e-2fa1432befd8","resolution":{"observed_at":"2026-05-11T03:55:54.882249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.07579","last_updated":"2026-05-11T03:09:39Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:49:36Z","title":"Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:25.989133Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.07579"},"observation_digest":"sha256:025b0b111900342f1e17524e1d3c0cc7f580e76bdf3e67c4ae9222fd2ab44d04","observation_id":"1bb2620f-65b2-4965-a974-ffd22c58c6b1","resolution":{"observed_at":"2026-05-12T06:41:45.835310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.08441","last_updated":"2026-05-08T20:03:19Z","snapshot_observed_at":"2026-08-02T05:33:25.541249Z","submitted_at":"2026-05-08T20:03:19Z","title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:11.065744Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.08441"},"observation_digest":"sha256:b4c6a1b341ebc936d385d4582e54b8053e6f060eea63cf1aeb7178031ecb72e7","observation_id":"f86cb607-eed8-4ff2-a252-14fb94b01f17","resolution":{"observed_at":"2026-05-12T07:46:28.647091Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.09188","last_updated":"2026-05-09T22:05:59Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:05:59Z","title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:49.428954Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.09188"},"observation_digest":"sha256:37260d40a9dfd92908c826aee1fdf564a9f67ee70cf2956a0915af89dc94e02b","observation_id":"12169cac-4b43-40bd-ae4d-62099273376f","resolution":{"observed_at":"2026-05-12T03:16:19.327965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.11235","last_updated":"2026-05-11T20:50:29Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:50:29Z","title":"Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T02:19:27.345348Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.11235"},"observation_digest":"sha256:754ee420032100221d34043926b7e594ed57d9e46a1a791738bcc6e4c5b485b2","observation_id":"117727e2-7d6b-4893-9a70-1b6ea6b10b7a","resolution":{"observed_at":"2026-05-13T02:22:06.806520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.13907","last_updated":"2026-05-13T03:36:57Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-13T03:36:57Z","title":"AIS: Adaptive Importance Sampling for Quantized RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T03:13:14.384567Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.13907"},"observation_digest":"sha256:298a5fffa32d760f5e4e1ee48c5b8d8fc6cece1f569cf2a9004d1129f02482a1","observation_id":"39a0d34e-3e63-4bc3-b2c7-ecb5096dfb5c","resolution":{"observed_at":"2026-05-15T03:14:52.595524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.15113","last_updated":"2026-05-18T19:19:17Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:27:34Z","title":"Learning from Language Feedback via Variational Policy Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T20:34:36.764090Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.15113"},"observation_digest":"sha256:34891668a2f6538c2324acff4cb76f901a914cd47667e35452be40ea3d565a42","observation_id":"2bd94e0d-39a0-4977-a38e-91ea45ade716","resolution":{"observed_at":"2026-05-20T20:39:00.348750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:c4ca407e17b035f0a7d29866960ec3dc0833369f3e4c044cf0b2b78ad6107f42","observation_id":"72467af6-8d03-4f29-8f8f-1424b2767578","resolution":{"observed_at":"2026-05-20T20:13:43.788110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.26606","last_updated":"2026-05-26T06:41:13Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T06:41:13Z","title":"Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T19:47:09.817243Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.26606"},"observation_digest":"sha256:fabed9ff7d8582938ba1e553bdf0004e3b480a5bdce53c21d91dd61401f8d24a","observation_id":"942d9897-902c-48e5-9eb4-31e12c4ae2cd","resolution":{"observed_at":"2026-06-29T19:53:55.782288Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.00135","last_updated":"2026-05-28T22:21:47Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-28T22:21:47Z","title":"On Effectiveness and Efficiency of Agentic Tool-calling and RL Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T08:38:52.411671Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.00135"},"observation_digest":"sha256:4c6fa0ee418a49fc3f7c4786632db2d71e75041f48c51c1bbcd6775a9341f285","observation_id":"24f670bc-ea5d-4b7e-a474-bd4cdf87ed2c","resolution":{"observed_at":"2026-06-29T08:43:15.361248Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:74edea5a754c83e22efd948b0b5926761d42b657c36e0aff554bb1071b9eb3b6","observation_id":"ba73a442-9db2-4e22-ab0a-1a24cbdae46a","resolution":{"observed_at":"2026-07-01T21:16:13.345991Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:dcf162c1fbec8a21209bc8d229931e194302de8e21516a9b5c26f48759e7462a","observation_id":"4c242cd4-ec7c-43f0-901d-3edb7e28c52e","resolution":{"observed_at":"2026-07-02T12:06:56.403920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.06828","last_updated":"2026-06-05T02:07:08Z","snapshot_observed_at":"2026-08-04T19:25:01.419366Z","submitted_at":"2026-06-05T02:07:08Z","title":"AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T22:54:21.740892Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.06828"},"observation_digest":"sha256:dce4155ebba8ec3bf54e09e9150b08648fe76b2f3e6b7f426f6aab590ed91684","observation_id":"9fe1ca1e-f844-438f-8466-60f0a59ecddc","resolution":{"observed_at":"2026-07-02T16:17:08.917602Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.08346","last_updated":"2026-06-06T21:29:01Z","snapshot_observed_at":"2026-08-07T19:43:22.618216Z","submitted_at":"2026-06-06T21:29:01Z","title":"CATPO: Critique-Augmented Tree Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:30:07.971424Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.08346"},"observation_digest":"sha256:09a92b4afc2da480136417a9329c4b2bfe85a29dc61990f88a27186f533e6ad9","observation_id":"342d495b-9320-40ba-adb9-58a2db117d97","resolution":{"observed_at":"2026-07-02T21:47:28.013303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.10768","last_updated":"2026-06-09T12:21:27Z","snapshot_observed_at":"2026-08-08T12:03:53.959178Z","submitted_at":"2026-06-09T12:21:27Z","title":"N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T14:02:05.833651Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.10768"},"observation_digest":"sha256:b1b49b8538f33cf5ff3df3d1975d1ddec73b81399011aedeb94e2d4829bf23f0","observation_id":"125b38d1-05be-4ade-bf2d-03ff4f6c5ced","resolution":{"observed_at":"2026-07-03T04:17:37.386022Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:210112addbe98b8c2e7cf5bdd41f3f9e39ce0ee91f1fd15a47d38be14c5044dc","observation_id":"1e5be0ca-5cbb-4df1-9a9e-4cb4ed65cca2","resolution":{"observed_at":"2026-07-03T09:47:59.851250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-08-01T00:29:00.908981Z","title":"Act only when it pays: Efficient reinforcement learning for LLM reasoning via selective rollouts.arXiv preprint arXiv:2506.02177,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.908981Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:6754b10967363fb80519f1f95ecd5df295e7edcd7842509d61f044769eb00890","observation_id":"3ea09dec-71d9-4b2d-9af3-1544d52c4ef9","resolution":{"observed_at":"2026-08-01T00:29:00.908981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-31T01:31:13.934392Z","title":"Bartoldson and Bhavya Kailkhura and Fan Lai and Jiawei Zhao and Beidi Chen , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.934392Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:da4ad5893601fbe25cae14ee6b9700e26a9230b67958a9d262e8413bee9f79a6","observation_id":"90c868fa-b460-46cc-b1cf-3190f1bd4b4e","resolution":{"observed_at":"2026-07-31T01:31:13.934392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-08-05T00:22:11.829438Z","title":"Bartoldson and Bhavya Kailkhura and Fan Lai and Jiawei Zhao and Beidi Chen , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00782","last_updated":"2026-08-01T17:29:14Z","snapshot_observed_at":"2026-08-07T03:55:00.582409Z","submitted_at":"2026-08-01T17:29:14Z","title":"Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T00:22:11.829438Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2608.00782"},"observation_digest":"sha256:1becf9dc74ac2f9bce0a6d8390a06ad3b6bf82d4174b05af8d9e1215d8356c90","observation_id":"79f0a914-cc9b-46b6-bf4d-f8132541aa86","resolution":{"observed_at":"2026-08-05T00:22:11.829438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02177/citation-record","integrity":"/paper/2506.02177/integrity","json":"/paper/2506.02177/citation-record.json","paper":"/paper/2506.02177"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:33:53.422853Z","title":"Aime problems and solutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.422853Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:7d512f3f1c79b8c12882627e5e1c8cf4bc9e2b7a78eeae62bc9bcb5cfe064565","observation_id":"d9831c0c-05e7-4a31-a01c-0fbc8f226c97","resolution":{"observed_at":"2026-08-07T11:33:53.422853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.025613Z","title":"Training.Our method is implemented based on verl (Sheng et al.,","venue":null,"work_id":"33bae1b3-7798-4b4b-9044-30b98e232df3","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.817375Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:3ef474ce4a8e874cc87779232650f99fc8c02b6b63ca2849176f8a1a55830781","observation_id":"0d8a338a-89e1-47db-ba73-d11448e44cda","resolution":{"observed_at":"2026-08-07T11:34:00.133936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-08T01:11:30.324736Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T11:33:54.037842Z","title":"On designing effective rl reward at training time for llm reasoning.arXiv preprint arXiv:2410.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.037842Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:77c902591dfc02a9b320586b2f36b495ae1085fce873d19f37b24cb7d778f271","observation_id":"23c8d49a-973f-49ee-95cc-884995a9bb2d","resolution":{"observed_at":"2026-08-07T11:33:54.037842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T11:33:54.160410Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.160410Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:ddd54e7fce1b91117e6e8c0716bb493986d9a306fd415e60fbec09eb3087c9d9","observation_id":"f9c3030d-ccd9-4bcc-bafd-d5082f7d4ebe","resolution":{"observed_at":"2026-08-07T11:33:54.160410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:01.004082Z","title":"Data-efficient finetuning using cross-task nearest neighbors","venue":null,"work_id":"ab268aff-9c15-4669-8fee-6ffda48ffbcd","year":2023},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.446718Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:ee4ebbd884e960fd065db0ef2cf53b91b38cdbb367fea9b66f6cae1ef46915a8","observation_id":"1513ae04-df18-4551-b3b0-5004701717db","resolution":{"observed_at":"2026-08-07T11:34:01.140721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01807","last_updated":"2025-06-19T04:19:15Z","snapshot_observed_at":"2026-08-08T01:22:30.771699Z","submitted_at":"2025-03-03T18:37:26Z","title":"Large-Scale Data Selection for Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01807","snapshot_observed_at":"2026-08-07T11:33:54.560575Z","title":"Large-scale data selection for instruction tuning.arXiv preprint arXiv:2503.01807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.560575Z"},"links":{"cited_paper":"/paper/2503.01807","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:311f441d8933b64b20ba702e72e5e6f80ecf4d2186e219cf9823554380c63b2c","observation_id":"9b82e5ce-5627-4432-acbb-de0cc0225403","resolution":{"observed_at":"2026-08-07T11:33:54.560575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T11:33:54.702600Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.702600Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:77da900f2c9445334200432f80999b6380e5fdc035d25b8080fc4cf2a3a0196e","observation_id":"aedd8de2-cdae-4679-b01c-fc73610148f5","resolution":{"observed_at":"2026-08-07T11:33:54.702600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T11:33:55.000411Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.000411Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:c918822adca15ee15f706e33cf40b24df0e26acfe963005a7a32c0950456345a","observation_id":"04d656e2-c62d-4612-92f6-7b1e770b01bd","resolution":{"observed_at":"2026-08-07T11:33:55.000411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:33:55.145743Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.145743Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:cdc276752886302d44d4d031a0dc89030ba375841b6562434b6510ce21b014b8","observation_id":"c30c30e7-a2a5-40f5-aa80-9eade33d7799","resolution":{"observed_at":"2026-08-07T11:33:55.145743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12146","last_updated":"2024-05-31T03:25:42Z","snapshot_observed_at":"2026-07-31T17:39:49.477346Z","submitted_at":"2024-02-19T13:57:55Z","title":"Enabling Weak LLMs to Judge Response Reliability via Meta Ranking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12146","snapshot_observed_at":"2026-08-07T11:33:55.280113Z","title":"Enabling weak llms to judge response reliability via meta ranking.arXiv preprint arXiv:2402.12146,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.280113Z"},"links":{"cited_paper":"/paper/2402.12146","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:e800830bc43abf14d830ab3bb489509c25e4a92806501290ab22bbcba0c566df","observation_id":"0f96e0ce-7823-441d-bc85-09fc21a62170","resolution":{"observed_at":"2026-08-07T11:33:55.280113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T11:33:55.416178Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.416178Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:5b86949ba9f04ade132b9feeb66933bd3f07ee6837ebbbefb16ae3c2d8ad25cc","observation_id":"281fdffb-7daf-4088-a06d-b603cad1e1f9","resolution":{"observed_at":"2026-08-07T11:33:55.416178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18252","last_updated":"2025-04-26T08:33:32Z","snapshot_observed_at":"2026-08-07T20:55:15.330079Z","submitted_at":"2024-10-23T19:59:50Z","title":"Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18252","snapshot_observed_at":"2026-08-07T11:33:55.521985Z","title":"Asynchronous rlhf: Faster and more efficient off-policy rl for language models.arXiv preprint arXiv:2410.18252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.521985Z"},"links":{"cited_paper":"/paper/2410.18252","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:92dd080afb1bbf2686033be4c9dede9ab9facb30ec8c5b2b4b15d42afccfa51c","observation_id":"6d8283ee-dc53-42bc-bf0b-7e40a6c8fb88","resolution":{"observed_at":"2026-08-07T11:33:55.521985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:33:55.643161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.643161Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:dfc2151e97a3042b60c712149390e267f932a8b181c51652b3fb596c80c2eabe","observation_id":"8325e58a-b228-4603-8f90-fa9d1df8c754","resolution":{"observed_at":"2026-08-07T11:33:55.643161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:33:55.813166Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.813166Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:dc15ab3e46e8138f59c2bbe4f83d5f3b6704018bfe14a3c9ff0a6eee00f8732f","observation_id":"58fd25b9-d2f3-4476-98de-d4e90c16c08c","resolution":{"observed_at":"2026-08-07T11:33:55.813166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T11:33:55.929448Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.929448Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:1eef6b86c58a70400a9b786deff154efae4bf7a9e201442e7e01ca889ecd9a65","observation_id":"10a3f3e9-9bb3-4dc5-aaa8-8ef6b83ed13e","resolution":{"observed_at":"2026-08-07T11:33:55.929448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:33:56.042626Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.042626Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:59ce64b3e49c1a3806ec16ff109c5fb18ea94d7977b1ce008d9b1746a3a5b56e","observation_id":"8bb4b8c2-2e6a-4fec-8a11-2d49ab3cd961","resolution":{"observed_at":"2026-08-07T11:33:56.042626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T11:33:56.370913Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.370913Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:be0fbc8875704db7150c09a14205223a51ae13d42395dd8f3fe74388f9d57d94","observation_id":"b7f103ad-20e3-4ede-b2fb-bba1a62b64ea","resolution":{"observed_at":"2026-08-07T11:33:56.370913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-07T11:33:56.534466Z","title":"Not all rollouts are useful: Down-sampling rollouts in llm reinforcement learning.arXiv preprint arXiv:2504.13818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.534466Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:dd4900b471b5e54e76291551f21b843b9dbfd44a3bcfe0cf588bddf10824b842","observation_id":"f678aa86-9893-4cd6-8d94-f0914b3a7036","resolution":{"observed_at":"2026-08-07T11:33:56.534466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T11:33:56.659506Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.659506Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:51d07b268b28e1f8900c18eff2223625fb47786a97a88f401bd5d186fda849c8","observation_id":"87883627-e99d-41f5-b282-cc9822319cae","resolution":{"observed_at":"2026-08-07T11:33:56.659506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T11:33:56.783335Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.783335Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:09231d9604ec9a373952b207361fe4ffaa3aa14e8105fd1bcd5a474e186c5b1f","observation_id":"40fb4ab4-d45f-4e03-adc9-c5a196ab3651","resolution":{"observed_at":"2026-08-07T11:33:56.783335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:33:56.907899Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.907899Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:8528b1e168094daf5d79f2c3f4027f3f8cb7c773dc49ebe5a889485948afe890","observation_id":"209e468b-62bb-4f5a-b75b-ea1eb0702bd0","resolution":{"observed_at":"2026-08-07T11:33:56.907899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T11:33:57.031251Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.031251Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:34d089110f3b9546cedaf2195ec2d66b0a3299905469ac800e24a980edb56cac","observation_id":"1871f2f7-c535-4ef7-9dcc-a2ad22c02ed6","resolution":{"observed_at":"2026-08-07T11:33:57.031251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-07T21:24:19.336829Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-07T11:33:57.154091Z","title":"Xiaotian Zhang, Chunyang Li, Yi Zong, Zhengyu Ying, Liang He, and Xipeng Qiu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.154091Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:28b203b69a81865c4bfdbd4048f0a456557beb35afcda8a942896c0e301c32bd","observation_id":"0550c118-947f-459e-bfbe-4a6c265c01e0","resolution":{"observed_at":"2026-08-07T11:33:57.154091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T11:33:57.305024Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.305024Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:4c7b5f60b27e62b5ab8a3f0b3648290130a4695438b1d648ee0cf0f209498af9","observation_id":"af96af09-a3de-4845-a58d-785ada5276b4","resolution":{"observed_at":"2026-08-07T11:33:57.305024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.769945Z","title":"Coverage-centric coreset selection for high pruning rates","venue":null,"work_id":"a1fedb21-a16d-4509-8359-9f8ed6cb00ca","year":2023},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.447663Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:2040a54fd2d835457a3fa95f35dfb49fa7e8a432959abecde1eb2f42cf6c836d","observation_id":"39da3963-895b-4fa0-9746-a8b686108307","resolution":{"observed_at":"2026-08-07T11:34:00.880737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.509592Z","title":"LLNL-affiliated authors were supported under Contract DE-AC52-07NA27344 and supported by the LLNL-LDRD Program under Project Nos","venue":null,"work_id":"927649a6-8379-4e98-bf3f-21de3c2c1320","year":2024},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.550465Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:bcdd3716d9ca58397860d5a24fbb8906ef159dad80c22e3700bc36a6dc0a54e1","observation_id":"b4b7d512-6da2-4e00-a08b-ae0adce931fb","resolution":{"observed_at":"2026-08-07T11:34:00.655878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.260004Z","title":"We find that training on DAPO alone can degrade performance on LaTeX-based benchmarks, so we augment it with MATH to preserve formatting diversity and improve generalization","venue":null,"work_id":"afafb738-107f-4ec5-8935-45ddb336fbd5","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.673181Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:8d6a130b661a2efea32774e035d71f8f376bce4442993fffc50ee10e4c4be7e3","observation_id":"9d4a53b0-6123-428b-ad5b-49517ad0fe3a","resolution":{"observed_at":"2026-08-07T11:34:00.370119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.737683Z","title":"We use 4xH100 for Qwen2.5-Math-1.5B training and 8xH100 for Qwen2.5-Math-7B and DeepSeek-R1-Distill-Qwen-1.5B","venue":null,"work_id":"be2f9371-1391-4920-a906-318b75ea9bd2","year":2023},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.964485Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:d036885d9e3b39a91c9bccacdd2b4eb2a1e0cc5f605bd0fce58b26eacaee12ac","observation_id":"97e561c9-9c20-4a84-abea-f46fe94f1050","resolution":{"observed_at":"2026-08-07T11:33:59.873088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.254776Z","title":null,"venue":null,"work_id":"d8237337-0584-46b7-b377-1689f1436bff","year":2021},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:58.212664Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:6183a4ac1970d8330c3a9e367600be5bff0d32448fccf968c62c84c907ea3176","observation_id":"7eafab92-670f-4b36-bd34-28395fb1569c","resolution":{"observed_at":"2026-08-07T11:33:59.357792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-07T11:33:53.510451Z","title":"Safe rlhf: Safe reinforcement learning from human feedback.arXiv preprint arXiv:2310.12773,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.510451Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:fc477bd4df7b7f5b82ec3df043c936635b1a9909b750333c84d59967ca3fd9ae","observation_id":"64209bf2-bcdd-4765-acb2-35b1ea20ce8e","resolution":{"observed_at":"2026-08-07T11:33:53.510451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.459990Z","title":"We use β1 = 0.9, β2 = 0.999, and apply a weight decay of 0.01","venue":null,"work_id":"8f7c4451-39c7-4bd3-9106-26f676ac9066","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:58.080472Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:4ea7d6c22ac3cd1a51a1be868c496d3efa782724c8c2e057c0904496b250552e","observation_id":"8efec914-804d-416f-bbd1-df6fdc0ad840","resolution":{"observed_at":"2026-08-07T11:33:59.602692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T11:33:56.204875Z","title":"Reinforcement learning for reasoning in large language models with one training example.arXiv preprint arXiv:2504.20571,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.204875Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:55af67df1452b6557f936d9b4e6265c0d592c2a169f7a31ae42b8d1e3cd22302","observation_id":"2a05e5e0-9c29-4444-89dd-426e927ce2b7","resolution":{"observed_at":"2026-08-07T11:33:56.204875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T11:33:54.297876Z","title":"Reinforce++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.297876Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:3bceb888366eb4b6f74faf778be6339c44fb80bc3e5d6f11c55b2e1cf2793689","observation_id":"078a963e-511f-47f7-90a5-90629883b038","resolution":{"observed_at":"2026-08-07T11:33:54.297876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-07T18:12:08.883357Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T11:33:54.876617Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.876617Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:8aaf668abd5efe25a7511b21710a073a5c4e14c0326b2e17fe614e6a24bdbbcc","observation_id":"5c790190-4f4c-4b4f-a4a2-43d7f28d5c46","resolution":{"observed_at":"2026-08-07T11:33:54.876617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-07-06T17:31:00.274878Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-08-07T11:33:53.628034Z","title":"Active preference optimization for sample efficient rlhf.arXiv preprint arXiv:2402.10500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.628034Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:212e32230ae235426617593c0d246884646ca8136a04b0f86e82f10186e5a2f4","observation_id":"5182579f-4527-4fea-820f-fafc04ade777","resolution":{"observed_at":"2026-08-07T11:33:53.628034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:33:53.786117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.786117Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:07dacfe1980d567b1e80bf3a376a968de1c7dc2b21db704d2e503cadf320357d","observation_id":"de08b487-e30d-48b1-90f0-2e748fca46e8","resolution":{"observed_at":"2026-08-07T11:33:53.786117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:53.916913Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025.https://github.com/huggingface/open-r1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.916913Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:d4afb38d4ec496c3e2b1069a3f76a658e29358fd5044b67b23185d35feb25848","observation_id":"d5eb21f6-e440-4230-a022-5f7f5ebe07d1","resolution":{"observed_at":"2026-08-07T11:33:53.916913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.021866Z","title":"We evaluate all models with temperature = 1 and repeat the test set 4 times for evaluation stability, i.e.,pass@1(avg@4), for all benchmarks","venue":null,"work_id":"74e1b636-d475-4215-bb96-406f9cfb250e","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":8196,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:58.345391Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:fa960531f98edd5d36f5c75c55dc5e2e20392d3f33e6a44877c511e0d9c60bde","observation_id":"9d935f1b-5438-49e7-a02b-8e5183d840bb","resolution":{"observed_at":"2026-08-07T11:33:59.131928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 28 inbound Pith citation observations for arXiv:2506.02177."}