{"as_of":"2026-08-06T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebd7d53070eb3c83bdcecf9aee8cd2e78277da7a7f0658666c2768f1eb517d82","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:21:08.269218Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:03:28.124820Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:08.457909Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-05T22:03:28.124820Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-05T22:03:26.820431Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.124820Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:627e3444cbcfe3bb2e9c56de90a8bf4d06b48b053f49863fdf76382d73d9fa63","observation_id":"c40f1373-96d7-47d6-bf88-a85fa7fb7c7d","resolution":{"observed_at":"2026-08-05T22:03:28.124820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:621374723d0c5714fd4bcbcead6a3e30a85687d7c554e4e4c744fb04da1ed316","observation_id":"799af097-4862-4a75-989d-849b0b503152","resolution":{"observed_at":"2026-05-18T19:21:48.591192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T22:59:14.473018Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models.arXiv preprint arXiv:2508.10751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-04T22:59:12.129500Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.473018Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:1354b2bbdcb11255292f4ea23ae27bbfe058f1523d5bc7b84e7886b0f3063a7f","observation_id":"d36f566e-f01d-46dc-9179-90ccd70433a4","resolution":{"observed_at":"2026-08-04T22:59:14.473018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:48a4b9dc3448a1111cba6645a14611f65928d884c7aaa796a2cec2f303c0a547","observation_id":"45b8b181-2879-4fdd-9eca-4e0f414cdbfa","resolution":{"observed_at":"2026-05-18T00:02:25.160513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2509.23629","last_updated":"2026-05-07T02:29:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T04:10:37Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T12:43:49.628082Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.23629"},"observation_digest":"sha256:be982814e162ba30b5067410b78c883f4bc16c8f6dcf4ef195394b38939c0f2e","observation_id":"88eb6109-4516-431f-a947-b6785bebb238","resolution":{"observed_at":"2026-05-18T12:46:24.288452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T11:33:56.981364Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04140","last_updated":"2026-07-01T03:04:05Z","snapshot_observed_at":"2026-08-04T11:33:53.462174Z","submitted_at":"2025-10-05T10:38:55Z","title":"Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T11:33:56.981364Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2510.04140"},"observation_digest":"sha256:f1c85ebcf44e95c4d23db121bd61d99d9f70164db8b26a0599d77883e4fc859e","observation_id":"191f6cdb-d00d-4350-822a-e95904af13b6","resolution":{"observed_at":"2026-08-04T11:33:56.981364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T09:34:06.058912Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T09:34:06.058912Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2510.14807"},"observation_digest":"sha256:00607f24841a48f727c9c21b06990c5ccf3ee9b05d81f9a0bc0e18a9557f651f","observation_id":"ce897c27-c9b9-450c-adff-e09bdc6df006","resolution":{"observed_at":"2026-08-04T09:34:06.058912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2602.06475","last_updated":"2026-05-13T09:12:10Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-06T08:03:11Z","title":"Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:21:01.335414Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2602.06475"},"observation_digest":"sha256:e20e7c8f32d17b407f4706297758875a9a5241274a3abe1ce9de9f17675f688b","observation_id":"f0672f5f-5a20-4c0a-a0c0-18135e3042d1","resolution":{"observed_at":"2026-05-16T07:22:31.160267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-02T20:44:43.950446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22642","last_updated":"2026-06-18T19:10:56Z","snapshot_observed_at":"2026-08-04T14:01:22.477463Z","submitted_at":"2026-02-26T05:47:30Z","title":"Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:44:43.950446Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2602.22642"},"observation_digest":"sha256:7aa3d30c069d67bf83296d7cb01331801840ef090529364fa35c5e68fb356372","observation_id":"365887bf-2e01-45cf-b80d-f1c14d8774aa","resolution":{"observed_at":"2026-08-02T20:44:43.950446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:6d9c00a55b6ca89a59c4ba5c93ed92695081a04fa1be1923d1dcb3b23f55e420","observation_id":"ad4def12-7ced-403f-bfb8-dd4bfafe21ec","resolution":{"observed_at":"2026-05-11T11:41:03.928079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2604.16972","last_updated":"2026-04-18T11:43:08Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T11:43:08Z","title":"MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T07:05:45.081955Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2604.16972"},"observation_digest":"sha256:4f1471cdbdcec98d85bf30396bf3bd5f90dcd4ce84219088861c6229c762eb64","observation_id":"493c6899-d3c8-491a-8f31-7eff9bddad66","resolution":{"observed_at":"2026-05-10T07:06:52.810362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:27ffa9562878bdf7c5260a14553a5b7c6f8784f9ff5b3bf6235bf3f8af2272fa","observation_id":"ffb3f9a7-bae6-4387-a39d-f03a74925aa4","resolution":{"observed_at":"2026-05-10T07:01:49.470700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:da6e4be3d23b24cb638022d3434eb06854db3b5b3cdb925d6d7efee0ed1086ea","observation_id":"6f9a438e-d767-480b-9e90-66e45d68f524","resolution":{"observed_at":"2026-05-11T15:26:15.655822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-09T19:26:57.596581Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:1151dd3a50a426641ab8160f58b354b722714cf21dc08921f24c5eca87daa1a6","observation_id":"3a3e0fe9-f636-46dd-a3e8-249b9504625c","resolution":{"observed_at":"2026-05-11T15:41:46.295094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:ce93243aad2da99bc4c22515a7e7db3bb194bde223133966d345f58506ff2a07","observation_id":"51162d63-f47d-4295-aad7-d13027ce7f2f","resolution":{"observed_at":"2026-05-11T03:55:56.520021Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.06523","last_updated":"2026-05-07T16:30:28Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T16:30:28Z","title":"On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:53.063991Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.06523"},"observation_digest":"sha256:98a8b83e257c870c1b032f30fefe9f601ab041f16d06211ecde37bc8130a8348","observation_id":"1b4bac14-8d4b-4e1b-99f9-62665a56480d","resolution":{"observed_at":"2026-05-11T19:06:10.050125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.07039","last_updated":"2026-05-07T23:38:50Z","snapshot_observed_at":"2026-08-02T16:36:23.528400Z","submitted_at":"2026-05-07T23:38:50Z","title":"PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T00:54:39.349292Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.07039"},"observation_digest":"sha256:bab9b3bb614339d80b649e7875f605ff4c0be7c81de43e545633241456376694","observation_id":"daa2a35e-d39a-4ae5-b48f-d4d49bffec98","resolution":{"observed_at":"2026-05-11T05:00:56.299422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.08817","last_updated":"2026-05-09T09:10:03Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:10:03Z","title":"How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:04.955816Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.08817"},"observation_digest":"sha256:1f919cba7c39b364d305c9422df79ff72162b5afe372ae11cfa12b5005a93bf0","observation_id":"b2396714-c593-4147-b06c-da2776362bf8","resolution":{"observed_at":"2026-05-12T03:26:19.271730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:e8ec41c9ca3614fbc063bec525fb306ac782b2a0819dd3dbaacacd09e8bbac60","observation_id":"a6579577-05d4-4a44-a098-bf48c50f0bf6","resolution":{"observed_at":"2026-05-12T04:21:22.408581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:57:30.877915Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:c6c2c769d2a795b8782d15890074b56a64d748b36e96b01697c3c0d3f1892fac","observation_id":"ed419b70-ffc5-4eae-bf39-c060302b0ee9","resolution":{"observed_at":"2026-05-13T02:07:09.183624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:48aba88a8b13c0604156956ae4a66bd65e7d739a53cb25eec7519cad511a5e21","observation_id":"4efd0409-3d61-4fff-90f7-0358f16c0b19","resolution":{"observed_at":"2026-05-20T22:49:10.563663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.18864","last_updated":"2026-05-15T07:42:21Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-15T07:42:21Z","title":"SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-20T20:09:42.841695Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.18864"},"observation_digest":"sha256:08ba92f2cc4f78abdab5587d83bbc5f37bd94841e8c6b6ad978d25fe04dabae4","observation_id":"9a1a4a03-0132-4c2f-b4ba-3a3c836b1e46","resolution":{"observed_at":"2026-05-20T20:13:44.104548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:a4114a62da0482caee3245be4901bf5d3186eb2dae95fd0db4e5fe3b738f795a","observation_id":"f26dcbd3-d925-49b1-91fb-13e1c3be1936","resolution":{"observed_at":"2026-05-20T05:33:04.068835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T06:01:17.988127Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.20854"},"observation_digest":"sha256:36bb19c5b214bf0762f262a1c2893c4bb49f7a32020e21a704f232a50e0542aa","observation_id":"dfe95361-ed25-42cd-8246-efab17eaac41","resolution":{"observed_at":"2026-05-21T06:03:59.249766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:02.539675Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.20854"},"observation_digest":"sha256:2fb5041ce47616bf777131d58f75008b3e0de175c7a368017488162252486c5c","observation_id":"f35f1a59-919b-493e-b88b-69a2bfa9def1","resolution":{"observed_at":"2026-06-30T17:34:57.515573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.20865","last_updated":"2026-05-20T08:01:01Z","snapshot_observed_at":"2026-08-03T17:48:27.538608Z","submitted_at":"2026-05-20T08:01:01Z","title":"Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:55:45.654673Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.20865"},"observation_digest":"sha256:3f162b31cf16edfd430c9afdf4f11f31724b1170d0dbff3225cfcc1ef2f054eb","observation_id":"42e13782-b429-419b-8dc1-0dce22bdd636","resolution":{"observed_at":"2026-05-21T05:59:41.116576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.21792","last_updated":"2026-05-20T22:36:11Z","snapshot_observed_at":"2026-08-03T03:37:10.269280Z","submitted_at":"2026-05-20T22:36:11Z","title":"Residual Skill Optimization for Text-to-SQL Ensembles","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T08:38:41.126772Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.21792"},"observation_digest":"sha256:2c0baa805a9e6c473749a76a004e4ea97e76a54c311ab62b16f0789b91b48cf0","observation_id":"97047d31-dc3f-44fd-ad7c-ac45de92f9ca","resolution":{"observed_at":"2026-05-22T08:41:17.254306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:e7b76b163bd1d993458df9d760732e768b0b0851fe0c4e5ebbc6e51c22f748bc","observation_id":"f655d136-4f42-443e-b1fa-a80c77dff8a4","resolution":{"observed_at":"2026-06-29T08:03:13.949295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.03608","last_updated":"2026-06-02T13:11:09Z","snapshot_observed_at":"2026-08-02T07:41:20.436955Z","submitted_at":"2026-06-02T13:11:09Z","title":"Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:53:00.223228Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.03608"},"observation_digest":"sha256:2014b95f6668a81bf2842c91df70d3bd531f431a57dea31898889d54d862ca0b","observation_id":"fc4b7227-bd3d-41aa-811f-d456642b1cf9","resolution":{"observed_at":"2026-07-02T02:26:27.306210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.05888","last_updated":"2026-06-04T08:57:45Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T08:57:45Z","title":"Retry Policy Gradients in Continuous Action Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T01:44:37.492572Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.05888"},"observation_digest":"sha256:8b56dba890d94ab741ac799369299582dacb4102cd686b67d3dfcbca7a8d7da8","observation_id":"19363c93-9a7d-400c-9e42-7115da93686e","resolution":{"observed_at":"2026-07-02T12:56:57.024097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:d6a022e9e3d272c557b10f99a6b4fc48b48d2cb5e6b3c5a17a79d589b67b4f86","observation_id":"b02f5bbd-79a9-4cf7-8857-b3f6bccb225e","resolution":{"observed_at":"2026-07-02T12:06:56.383237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e6ef3f40995f0cd1cf21d96e42a039211aec88f27d07501d254a551e03e13a62","observation_id":"742e7457-58dc-4252-90bd-f8328b9c11b5","resolution":{"observed_at":"2026-07-02T12:16:56.976361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.18487","last_updated":"2026-06-22T09:16:48Z","snapshot_observed_at":"2026-08-05T23:38:39.942175Z","submitted_at":"2026-06-16T20:59:55Z","title":"SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T01:15:18.237335Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.18487"},"observation_digest":"sha256:f48fe3b1d9f8ad6bbf0d380869dffcee70918f5b2faf5b572d6f10c8071a1285","observation_id":"eeba6203-dd94-4814-ae96-c7756f3bf42c","resolution":{"observed_at":"2026-07-03T20:38:55.621080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.18910","last_updated":"2026-06-17T10:37:23Z","snapshot_observed_at":"2026-08-02T21:25:42.997753Z","submitted_at":"2026-06-17T10:37:23Z","title":"REVES: REvision and VErification--Augmented Training for Test-Time Scaling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:15.337979Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.18910"},"observation_digest":"sha256:9ce7504d16c78726317228edccb8045d663ab6922553ae48a070496ccb1a4ee4","observation_id":"31da5b42-3f07-437e-aab9-7e9d4d976486","resolution":{"observed_at":"2026-07-04T00:19:14.053289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.21090","last_updated":"2026-06-17T18:03:06Z","snapshot_observed_at":"2026-07-30T06:23:05.041940Z","submitted_at":"2026-06-17T18:03:06Z","title":"Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T21:07:28.660119Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.21090"},"observation_digest":"sha256:a5c2f041e0b6130af57714deeaa672aa682504be251135c2ade6c17d9db36be2","observation_id":"a43c264f-4835-47fe-934d-7d24b231d5d5","resolution":{"observed_at":"2026-07-04T00:29:16.717650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-02T03:35:37.854415Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:96a6cee074590b24fd42be950f71e57c9db1c97f654c511b4d18ca36f3ce1117","observation_id":"daa031ff-e73d-4e70-88eb-e64ef10d3383","resolution":{"observed_at":"2026-07-04T21:00:08.459905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2607.01490","last_updated":"2026-07-01T21:39:19Z","snapshot_observed_at":"2026-07-07T00:07:04.211507Z","submitted_at":"2026-07-01T21:39:19Z","title":"Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-03T20:59:57.539909Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.01490"},"observation_digest":"sha256:c2ca1b6ebaae8fedb72d0634f4cb7318963f332c880e08b816fbeb185bbd0156","observation_id":"c3aac177-1822-4da3-9390-aeb872f3e1f0","resolution":{"observed_at":"2026-07-03T21:08:57.650057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2607.02390","last_updated":"2026-07-02T16:25:10Z","snapshot_observed_at":"2026-08-03T00:49:51.748486Z","submitted_at":"2026-07-02T16:25:10Z","title":"DecompRL: Solving Harder Problems by Learning Modular Code Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-03T16:30:34.793328Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.02390"},"observation_digest":"sha256:217112f556a8ce4d6ccbeafa53f989d6121909d536daf303ff379004507bb973","observation_id":"65a40f4f-3a54-45ee-94f8-cb0002af75a6","resolution":{"observed_at":"2026-07-03T16:38:39.768877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-12T05:08:55.438431Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models.arXiv preprint arXiv:2508.10751, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03065","last_updated":"2026-07-03T07:57:31Z","snapshot_observed_at":"2026-08-04T16:54:48.110142Z","submitted_at":"2026-07-03T07:57:31Z","title":"Spectral Rewiring for Exploration, Purification, and Model Merging","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T05:08:55.438431Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.03065"},"observation_digest":"sha256:e70b0e1e819fbe76e61b97b6b2dea7bd790b1f7908bfcedd61fc8ee0c0975366","observation_id":"735e13ff-2756-48e3-88b5-344b01ad6948","resolution":{"observed_at":"2026-07-12T05:08:55.438431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-02T06:37:36.599379Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.599379Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:671b8a5de2aec5ebe6d937de38083079c99f617dce60f6f2e3abd89cd48a3ce3","observation_id":"11a1f182-415f-45d8-a3ec-9b9c8e7a7bd0","resolution":{"observed_at":"2026-08-02T06:37:36.599379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-01T08:41:09.320896Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models.arXiv preprint arXiv:2508.10751, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27372","last_updated":"2026-07-29T18:25:17Z","snapshot_observed_at":"2026-08-06T07:15:21.538996Z","submitted_at":"2026-07-29T18:25:17Z","title":"Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T08:41:09.320896Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.27372"},"observation_digest":"sha256:b9b0622509b1d25d4d6569657d59f7b0e39789437c211548466097a1e16f83ed","observation_id":"f3e1b247-a286-4779-8f1e-f44820c54e7c","resolution":{"observed_at":"2026-08-01T08:41:09.320896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-05T00:54:52.387697Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00494","last_updated":"2026-08-01T07:35:06Z","snapshot_observed_at":"2026-08-06T16:16:31.012702Z","submitted_at":"2026-08-01T07:35:06Z","title":"TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T00:54:52.387697Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.00494"},"observation_digest":"sha256:9f61779769d6dc7654be05ca22758b3e4a80ae5c64abcebcae3ba9fb7ea49cf4","observation_id":"53d17f62-7644-4900-8a92-e26913548d27","resolution":{"observed_at":"2026-08-05T00:54:52.387697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T15:25:49.330187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-06T15:44:22.700726Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T15:25:49.330187Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:8b6e4f1201b484a746a2512c60138106b2d294710a357479ecea07882e35b26f","observation_id":"1f503e5d-6900-4a9f-9df7-401fa10d48df","resolution":{"observed_at":"2026-08-04T15:25:49.330187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T13:44:40.174330Z","title":"arXiv preprint arXiv:2508.10751 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-06T16:34:53.263800Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.174330Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:938ceffc95cc72b99e0f4354d4650054a58e09c0f6c0053afb276e52621e276f","observation_id":"53186b75-65a6-4686-bc35-4da457bbb35e","resolution":{"observed_at":"2026-08-04T13:44:40.174330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10751/citation-record","integrity":"/paper/2508.10751/integrity","json":"/paper/2508.10751/citation-record.json","paper":"/paper/2508.10751"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-05T20:21:04.023052Z","title":"L1: controlling how long A reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.023052Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:1d2ff4552552dfc1bfb9426ddb06de5ddf095cbfc422a6e66c0e5283f5f87b9b","observation_id":"20fe78a0-c3b7-4dba-9e54-00d8c30a84d5","resolution":{"observed_at":"2026-08-05T20:21:04.023052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.634295Z","title":"Aime2024, 2024","venue":null,"work_id":"50959846-e8cb-4520-bf2a-e9d1a2c6963a","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.149401Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:a847ffd4c2b0db2967eef12bf3d3da8324b99014f621b36dafe4d3192d44efe6","observation_id":"e4f65368-aa33-417e-a8cc-39db8d830f48","resolution":{"observed_at":"2026-08-05T20:21:09.639070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.619073Z","title":"Aime2025, 2025","venue":null,"work_id":"45585717-7112-4533-b2db-1ce9784e0c81","year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.271095Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:7a45a0f862749853cd1d2e79d7da0518c162d0a5b749af91d1dd67a061c75123","observation_id":"311c3a56-09ae-41db-bcc8-c81911226bee","resolution":{"observed_at":"2026-08-05T20:21:09.624512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-05T14:31:11.993339Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T20:21:04.419668Z","title":"A survey of exploration methods in reinforcement learning.CoRR, abs/2109.00157, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.419668Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:9836bb1eddc86c9b4add8babeb8a097c0e44838c8efb8a86859dda30c55bf2fd","observation_id":"62f72c5a-6235-4654-bc26-fe632c7dce51","resolution":{"observed_at":"2026-08-05T20:21:04.419668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T20:21:04.577447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.577447Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:2a6f8d206419a063209a9a379e371d017cc563a55afc0a1653850f72b4ea59e4","observation_id":"e7c1322f-379a-4b7f-a5f3-bdd4942d70a7","resolution":{"observed_at":"2026-08-05T20:21:04.577447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.603694Z","title":null,"venue":null,"work_id":"b3c72ddc-a01c-4e91-8054-11e9279f715b","year":2023},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.749033Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:ddc9ab598819b3ee86a670a3e86b8fab3e214fb12c752fb2d2763af23515a41e","observation_id":"3343a24b-c34c-4c73-b8dd-5dcf52e709bf","resolution":{"observed_at":"2026-08-05T20:21:09.609052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19914","last_updated":"2025-06-09T07:49:32Z","snapshot_observed_at":"2026-07-06T21:30:37.657153Z","submitted_at":"2025-05-26T12:40:31Z","title":"Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19914","snapshot_observed_at":"2026-08-05T20:21:04.915607Z","title":"Enigmata: Scaling logical reasoning in large language models with synthetic verifiable puzzles.CoRR, abs/2505.19914, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.915607Z"},"links":{"cited_paper":"/paper/2505.19914","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:6523152cdf154b8faa6cd212a6f24b59213ce885cd74ab4b37fe393bd53329bd","observation_id":"fd4291e8-8156-4eed-a22b-59ee16b57e10","resolution":{"observed_at":"2026-08-05T20:21:04.915607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.589052Z","title":"Improving large language models via fine-grained reinforcement learning with minimum editing constraint","venue":null,"work_id":"e1b30db2-72ac-414b-b38e-b0692b22cabd","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.110565Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d1f813a4706a3ac1c40af8e6ba7c04edb0646c92ff61c57e99e4e9e187ad6109","observation_id":"42cc8885-3790-443d-b3e1-dab8a68371a9","resolution":{"observed_at":"2026-08-05T20:21:09.593888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-06T13:29:31.100373Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-05T20:21:05.350521Z","title":"An empirical study on eliciting and improving r1-like reasoning models.CoRR, abs/2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.350521Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:915172fa1b6b97eac8163989f90e1d0f160d38e5cb268f9cf45bd59c04742342","observation_id":"9a097a0b-09ff-4ebf-8733-eafab4a5893d","resolution":{"observed_at":"2026-08-05T20:21:05.350521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T20:21:05.510301Z","title":"Reasoning with exploration: An entropy perspective.CoRR, abs/2506.14758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.510301Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:1f4f13921262e187b90e1e4a49a20059c415fb768b7abf33c8b8a60990c51558","observation_id":"99805c56-6e20-4578-aacb-2b4bb2e1fcf4","resolution":{"observed_at":"2026-08-05T20:21:05.510301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:05.724526Z","title":"Thinker: Learning to think fast and slow.CoRR, abs/2505.21097, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.724526Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:eb72394e12318ed953f973f2d7c56d4a09cfd505fcf2c44e2538e3d74a901ee8","observation_id":"b7a6e9fb-9cdc-4e8f-81d3-5e95ae19aa19","resolution":{"observed_at":"2026-08-05T20:21:05.724526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T20:21:05.883163Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.CoRR, abs/2505.22617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.883163Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:79a19f452c0e08ef9d5fc5a9f99c72058b86868005a00f85dd88d7e08339c6cd","observation_id":"1139fa17-a670-4e6a-8954-5c8efaa7a883","resolution":{"observed_at":"2026-08-05T20:21:05.883163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:21:06.013467Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.013467Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:102fc68c15f04d68637caa0acadd2f120388640b81ced791d2bfc2c201d05be7","observation_id":"2d842488-652c-4c9c-8f1b-b8d7477819f7","resolution":{"observed_at":"2026-08-05T20:21:06.013467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:21:06.145355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.145355Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:efe4261bb4cd510c2dbd1bb461daf10882fb758a2cef9e741c42c9174ee4d27a","observation_id":"6c23da36-7ce8-4391-813e-3aa311c32bc2","resolution":{"observed_at":"2026-08-05T20:21:06.145355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.574238Z","title":"Stochastic first- and zeroth-order methods for nonconvex stochastic program- ming","venue":null,"work_id":"835912aa-1c43-42c0-bb9d-2e8c6e267ccc","year":2013},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.230165Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:21e99a0113c1c537b20dcffe693779301bf9f4ab3e6472b60fae23b575d4eb16","observation_id":"c0c2e054-71b3-4084-bd1a-8c9069851b83","resolution":{"observed_at":"2026-08-05T20:21:09.579100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.558782Z","title":"Bootstrap resampling methods: something for nothing?The Annals of thoracic surgery, 77(4):1142–1144, 2004","venue":null,"work_id":"26b4309d-bb7f-481a-ad8f-b77c906ff768","year":2004},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.330232Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:53e079614bf1a49cac021c8efebb9a5cd8202bcbdf195ceff8f269d399198e16","observation_id":"7084e6e2-2365-41dd-a044-67fafd312f2b","resolution":{"observed_at":"2026-08-05T20:21:09.563898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T20:21:06.466198Z","title":"Seed1.5-vl technical report.CoRR, abs/2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.466198Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:8cb1eb140945372e549aeb8013a4785e581f239fbb2a1bd2b9582ca58590013a","observation_id":"baf71de0-f6fb-4fa1-b7ac-c21f72141e0a","resolution":{"observed_at":"2026-08-05T20:21:06.466198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-05T20:21:06.606460Z","title":"Skywork open reasoner 1 technical report.CoRR, abs/2505.22312, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.606460Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:9b93dcb0f7f3d5966f7a8118e9c4fef817773c43aa8548026c900a13b3d6ebce","observation_id":"628887d4-4e15-42f6-bfb4-b9b8d72704ec","resolution":{"observed_at":"2026-08-05T20:21:06.606460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-05T20:21:06.704021Z","title":"Glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.704021Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d5209cee37e007745d8ee4f202d3ad59237391cd67219596bb7150258e66376d","observation_id":"245b89ef-4157-44b5-b6b4-b08d30903107","resolution":{"observed_at":"2026-08-05T20:21:06.704021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-02T09:44:45.484509Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11651","snapshot_observed_at":"2026-08-05T20:21:06.806080Z","title":"Advancing language model reasoning through reinforcement learning and inference scaling.CoRR, abs/2501.11651, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.806080Z"},"links":{"cited_paper":"/paper/2501.11651","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:c058085fb1e996d2e5c01f19647e755e9c021ce2e3916b9b90600c91c90e36bc","observation_id":"ac01cefd-0396-434f-892a-51412916c5c1","resolution":{"observed_at":"2026-08-05T20:21:06.806080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T20:21:06.909124Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.CoRR, abs/2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.909124Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:2653179c2f0aa11ac9fdbc070f090bab252eb6d101ac506a1dbb943105c0fe2e","observation_id":"2e500108-796a-4d7f-aa74-1553e62ba1c5","resolution":{"observed_at":"2026-08-05T20:21:06.909124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20633","last_updated":"2025-05-27T02:18:59Z","snapshot_observed_at":"2026-08-04T06:54:42.095340Z","submitted_at":"2025-05-27T02:18:59Z","title":"Test-Time Learning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20633","snapshot_observed_at":"2026-08-05T20:21:07.016294Z","title":"Test-time learning for large language models.CoRR, abs/2505.20633, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.016294Z"},"links":{"cited_paper":"/paper/2505.20633","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:aba79642f0a8bf607b42e4ae419539f5ec4069bf8f01170952fcccd0840ad28a","observation_id":"6ee29c13-b5f9-431d-a2c7-d3841c64ad5f","resolution":{"observed_at":"2026-08-05T20:21:07.016294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T20:21:07.122698Z","title":"Openai o1 system card.CoRR, abs/2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.122698Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:3b40219e2636620c175087c81594218be810a0dc684fe03255b68638624907a3","observation_id":"3c53f383-d82f-45cc-81e8-90294d83ced7","resolution":{"observed_at":"2026-08-05T20:21:07.122698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T20:21:07.228054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.228054Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d2468b82e6a342fd4f9dd4efc6c5347228915944b2511f53112817615a739fe6","observation_id":"b84b9ea5-a56b-42ca-a579-831457015b47","resolution":{"observed_at":"2026-08-05T20:21:07.228054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-03T23:35:43.336278Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10406","snapshot_observed_at":"2026-08-05T20:21:07.329389Z","title":"PAG: multi-turn reinforced LLM self-correction with policy as generative verifier.CoRR, abs/2506.10406, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.329389Z"},"links":{"cited_paper":"/paper/2506.10406","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:1ea5ca59ccf154d8eedc294ab27357a336d02fc53bb3acd86e1ee78cb87dfd7c","observation_id":"280a78ad-13ba-4915-9c95-3bed5a25b21d","resolution":{"observed_at":"2026-08-05T20:21:07.329389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T20:21:07.431738Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.431738Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:c23a8128894d7f52f870f3418c950574f98548e8e13a5c6c2405972eb3d31cf4","observation_id":"51ff1928-5d33-47cd-8da2-fce57a9ac1d9","resolution":{"observed_at":"2026-08-05T20:21:07.431738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.542122Z","title":"PP-PG: combining parameter perturbation with policy gradient methods for effective and efficient explorations in deep reinforcement learning","venue":null,"work_id":"4fe8d8eb-7873-46fb-a2e1-fd6eb10669b2","year":2021},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.527540Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:1c437cf09fb3e51ce455929449e9f72aeaf39dab7c1a7cfd6b22fc279b00b689","observation_id":"7e909de1-669d-4dfc-90ad-4dee4fa37e3b","resolution":{"observed_at":"2026-08-05T20:21:09.548074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T20:21:07.634233Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.CoRR, abs/2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.634233Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:6029228368c47e79040b4c037d3c0ea87ce2714f794043f6750eeb7bf05f80cb","observation_id":"de686465-cf53-4b9e-89c3-2a3fdf6af3de","resolution":{"observed_at":"2026-08-05T20:21:07.634233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13445","last_updated":"2025-05-19T17:59:31Z","snapshot_observed_at":"2026-07-06T21:26:30.087184Z","submitted_at":"2025-05-19T17:59:31Z","title":"Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13445","snapshot_observed_at":"2026-08-05T20:21:07.730797Z","title":"Trust, but verify: A self-verification approach to reinforcement learning with verifiable rewards.CoRR, abs/2505.13445, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.730797Z"},"links":{"cited_paper":"/paper/2505.13445","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:8ac94a3292d72e4295166cfc5ab251fde0436ed15cd84e350ba56661e0976e49","observation_id":"31165b7e-a287-40f2-af57-a8ecee7d2dbb","resolution":{"observed_at":"2026-08-05T20:21:07.730797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T20:21:07.843467Z","title":"Understanding r1-zero-like training: A critical perspective.CoRR, abs/2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.843467Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:afb7fa4527037f526d157a71a5399df4daec8c96465ef4a301a73e6127d4bd13","observation_id":"d0e5f048-ce60-4b9d-8933-0fe3d1f6116c","resolution":{"observed_at":"2026-08-05T20:21:07.843467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:07.944339Z","title":"Inference-time scaling for generalist reward modeling.CoRR, abs/2504.02495, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.944339Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d660c25e16119b90c84013312cdb0d425937ffb5150c03d5b5391f101901433f","observation_id":"135cdd04-f9ce-4df2-a4c2-2a1b862eefb8","resolution":{"observed_at":"2026-08-05T20:21:07.944339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07787","last_updated":"2025-05-12T17:39:56Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:39:56Z","title":"Learning from Peers in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07787","snapshot_observed_at":"2026-08-05T20:21:08.060154Z","title":"Learning from peers in reasoning models.CoRR, abs/2505.07787, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.060154Z"},"links":{"cited_paper":"/paper/2505.07787","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:cdfd82498492d9f685030668ba3abdc108bf274f0a89a5cb086682231c737811","observation_id":"63245719-83c1-421f-965f-4e7e4baeb7c0","resolution":{"observed_at":"2026-08-05T20:21:08.060154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-05T20:21:08.144794Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.CoRR, abs/2502.06781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.144794Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:b288e14a4baa40dfb4770013db301fff2d888f81c3d4b04d727eea81876d0868","observation_id":"9eaa3cc7-49dd-4760-9e89-0b0c97512861","resolution":{"observed_at":"2026-08-05T20:21:08.144794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.526136Z","title":"Nesterov and Vladimir G","venue":null,"work_id":"a8c7e13e-939e-451c-86eb-4f2d612ff332","year":2017},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.150455Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:af414710c710ceed28e6b7355bbde7f7348f06b72d126e863bb3619967859c27","observation_id":"21f9c201-1872-4147-bbf2-d17c4396691d","resolution":{"observed_at":"2026-08-05T20:21:09.532062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04842","last_updated":"2026-04-12T16:48:19Z","snapshot_observed_at":"2026-08-02T13:20:15.810974Z","submitted_at":"2025-05-07T22:41:26Z","title":"Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers","version":2},"cited_work":{"arxiv_id":"2505.04842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04842","snapshot_observed_at":"2026-08-05T20:21:08.858224Z","title":"Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers","venue":"cs.LG","work_id":"60b17354-00f6-460f-9176-6c873d498703","year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.155057Z"},"links":{"cited_paper":"/paper/2505.04842","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:455dcd7b98896ee2d97a98878c3368fbfed35b20b30c9b989393f00dbdbaf9fb","observation_id":"4c3ddb77-da42-4ce6-a580-5cc87dd8b440","resolution":{"observed_at":"2026-08-05T20:21:08.865359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T20:21:08.159316Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.159316Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:357106bf2f124e81574a8e43c0c881ac415fafc600bf099f1ad567a97353f0bf","observation_id":"66f0cbd1-9156-4f7c-be0c-512a26e701f1","resolution":{"observed_at":"2026-08-05T20:21:08.159316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-07-06T21:39:56.824255Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T20:21:08.163389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.163389Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:926fe7421c60908dfa43f08e3a3a1cff281694b4bdf42a54bedc4954d29873e6","observation_id":"2dc96f34-873c-4b75-ae35-482082edbde9","resolution":{"observed_at":"2026-08-05T20:21:08.163389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T20:21:08.167577Z","title":"Spurious rewards: Rethinking training signals in RLVR.CoRR, abs/2506.10947, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.167577Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:788d97637bab1db91b1882da8f0ee00951fd46d23d0c8c14b113fa0780437c99","observation_id":"06d7b561-f235-48b0-80e6-e4599b64f9c2","resolution":{"observed_at":"2026-08-05T20:21:08.167577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T20:21:08.171925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.171925Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f211cac377305274a71d9cbf4245b970829d5aca5a014f2a2b530aaea6748aa8","observation_id":"0d6b4713-7f46-4386-95c7-6c6a7dfa789f","resolution":{"observed_at":"2026-08-05T20:21:08.171925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.508298Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":"292d45cc-f0ee-4b41-bc59-e3395aed5481","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.176068Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:9d2b4afc188b5564eb3f64fc67d7bfe0b433dc0edf6257b3d3906e31caa5b3c1","observation_id":"02db5137-7dcd-4074-b5f8-5b25a7ef2719","resolution":{"observed_at":"2026-08-05T20:21:09.514447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21380","last_updated":"2026-04-12T10:37:12Z","snapshot_observed_at":"2026-08-02T16:04:50.458535Z","submitted_at":"2025-03-27T11:20:17Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21380","snapshot_observed_at":"2026-08-05T20:21:08.180531Z","title":"Challenging the boundaries of reasoning: An olympiad-level math benchmark for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.180531Z"},"links":{"cited_paper":"/paper/2503.21380","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:1f534565c40ad8552273ef6fb7991827fe0ea7d8332d1b442f6b58f395b55a86","observation_id":"871c4546-f675-4c08-b313-9a27eaa3a600","resolution":{"observed_at":"2026-08-05T20:21:08.180531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-07-06T20:58:23.695292Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-05T20:21:08.184900Z","title":"Optimizing language models for inference time objectives using reinforcement learning.CoRR, abs/2503.19595, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.184900Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:6961616b5d7f6fa2d3421da3d7be3cb8cbb1f11649972e6a7f4e6e080b2be20a","observation_id":"8e997e85-8055-440b-a0ec-1515799f464c","resolution":{"observed_at":"2026-08-05T20:21:08.184900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T20:21:08.189939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.189939Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:e2a333917954e90413d0a25d24de869f0828d3690f8957f148508b51c7563f50","observation_id":"628a0a5e-3563-4f67-926e-7662a64adb4c","resolution":{"observed_at":"2026-08-05T20:21:08.189939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.490694Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":"fd28ee25-7fb6-4d42-8bd5-27ef3b9e413b","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.194262Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:9628cad2472467456cb4d3d1bd7ba3c2614081c8e0db659db169b7140e418a6e","observation_id":"0d71cc55-8d76-47da-a7e8-3bd0ded1ff70","resolution":{"observed_at":"2026-08-05T20:21:09.495740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15201","last_updated":"2026-06-10T06:51:36Z","snapshot_observed_at":"2026-07-06T21:27:37.409259Z","submitted_at":"2025-05-21T07:26:36Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15201","snapshot_observed_at":"2026-08-05T20:21:08.198160Z","title":"Pass@k policy optimization: Solving harder reinforcement learning problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.198160Z"},"links":{"cited_paper":"/paper/2505.15201","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:190679ae63d214e32e96f606792ec4bed300506ffcbee1f46bd9df010fcbb533","observation_id":"96da9560-e314-4886-91b2-7cde506d392d","resolution":{"observed_at":"2026-08-05T20:21:08.198160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.473474Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"47fda11b-cea9-4b47-9d74-6fa2bcd3ac3d","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.202417Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:c5dd1fb579bf853564b760b8b1cc19a0123fbd9ae2eaeb4cdb3491aeeed409bf","observation_id":"46f7412a-5d75-498b-b50c-d766cf13e929","resolution":{"observed_at":"2026-08-05T20:21:09.479040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T20:21:08.206755Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for LLM reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.206755Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:7617b5512a2832eca97236fc03c66c6633f9ee2ffb568e3aac4ca74a59ec6835","observation_id":"8c9b5026-2071-446b-9b77-2a7369af0836","resolution":{"observed_at":"2026-08-05T20:21:08.206755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.456933Z","title":"Williams","venue":null,"work_id":"8d34984b-ff0e-4b70-a60f-c594c7bf11a1","year":1992},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.211104Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:b5de720ab9b694a0b60a32ce34329748b7cf25c87b1d90543124a4148e60dfc3","observation_id":"8bbbfd40-7616-42d9-8616-39e8c6566b31","resolution":{"observed_at":"2026-08-05T20:21:09.462263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:08.215587Z","title":"ARM: adaptive reasoning model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.215587Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:90eee745ad82bdbc194af3714cb050068647bf72df56c701f492585bc39e73bb","observation_id":"3e5fc915-e57f-440b-96a8-326d3280e5a2","resolution":{"observed_at":"2026-08-05T20:21:08.215587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-05T20:21:08.221916Z","title":"Logic-rl: Unleashing LLM reasoning with rule-based reinforcement learning.CoRR, abs/2502.14768, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.221916Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f0c519b2e26f921ec12b91927a211d57a4ee5d1f84a8678112cbd0ff6bdf7155","observation_id":"2b52b9ed-e82c-42e1-bdb1-a84c211552fe","resolution":{"observed_at":"2026-08-05T20:21:08.221916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T20:21:08.226479Z","title":"Qwen2.5 technical report.CoRR, abs/2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.226479Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:adf05a70a6e4347bbf083f57b331c67183c21746dc2493a07754d00c5552ac5f","observation_id":"e394acda-e293-45be-98a7-f889ebaef45f","resolution":{"observed_at":"2026-08-05T20:21:08.226479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T20:21:08.230632Z","title":"DAPO: an open-source LLM reinforcement learning system at scale.CoRR, abs/2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.230632Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:cd49dc373c9e2339e76d0e9f76797f06787ffd98711da7238f3dc4bb549c7e40","observation_id":"fe7ddb09-536d-440d-9862-378a9c939715","resolution":{"observed_at":"2026-08-05T20:21:08.230632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T20:21:08.234662Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?CoRR, abs/2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.234662Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:df8b5e7c17190da97dc095c9a83823e77d2c2cfa0af6d3248c44ade4d44e4ec5","observation_id":"69c396b7-6c36-4336-b590-bd8dffcba871","resolution":{"observed_at":"2026-08-05T20:21:08.234662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-05T20:21:08.239014Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.CoRR, abs/2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.239014Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:7b96c166f99c30181ef6b3b8011f55b5cf06c887325a67e459a286aac31b9795","observation_id":"de3cb2e2-c7c8-4fea-b012-22ad3ae2bae9","resolution":{"observed_at":"2026-08-05T20:21:08.239014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:08.243328Z","title":"Boning, and Dina Katabi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.243328Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f073fed8b0d258a47d5e156e9b2020e352be07fa0deb340b858b9da76dcb0e51","observation_id":"8d6ef5ab-efdf-4d0c-b7e4-1c4240bdf064","resolution":{"observed_at":"2026-08-05T20:21:08.243328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.440113Z","title":"Zeroth-order policy gradient for reinforcement learning from human feedback without reward inference","venue":null,"work_id":"97447c0f-ed5c-44be-a780-40e1d6ebade2","year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.247207Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:91bac89da0bf6e30bfe0503ed51d68b140f4931b419b71cfac6d883ad379043c","observation_id":"dcac152f-aad7-4d74-a694-d4bd78ebca09","resolution":{"observed_at":"2026-08-05T20:21:09.445445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-03T03:32:58.169782Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-05T20:21:08.251549Z","title":"What, how, where, and how well? A survey on test-time scaling in large language models.CoRR, abs/2503.24235, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.251549Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f4e73a8616b468c8a2c00228ef78dce4e7fbf933586ac8400778405b0b9eaf38","observation_id":"635baa46-0aa2-4c0c-83e7-d034e1aa98a7","resolution":{"observed_at":"2026-08-05T20:21:08.251549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16849","last_updated":"2024-12-22T04:21:30Z","snapshot_observed_at":"2026-08-03T21:50:10.739589Z","submitted_at":"2024-12-22T04:21:30Z","title":"OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16849","snapshot_observed_at":"2026-08-05T20:21:08.255765Z","title":"Openrft: Adapting reasoning foundation model for domain-specific tasks with reinforcement fine-tuning.CoRR, abs/2412.16849, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.255765Z"},"links":{"cited_paper":"/paper/2412.16849","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:8724351addb9a84efbb7f3f4c81fae3adefa6936ed09225c33e3588c09fae346","observation_id":"af82a7c5-9336-4f8c-a046-38fcc0f9ade4","resolution":{"observed_at":"2026-08-05T20:21:08.255765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:08.260188Z","title":"The surprising effectiveness of negative reinforcement in LLM reasoning.CoRR, abs/2506.01347, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.260188Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:67b8ec75dd8250c72efb01c8f2d1437d388e61171cf5b7d5b11e878d25a4e925","observation_id":"b7303c30-23fe-4d3d-afb2-afc9e91ecb71","resolution":{"observed_at":"2026-08-05T20:21:08.260188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.423652Z","title":null,"venue":null,"work_id":"ce08c57a-9dc1-4cfc-9717-71e0660734b9","year":2006},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.264276Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d65761248fd6bca15c46e78ccfab84c0232c1370d9d4ff18c2caa6e3aeecfb2c","observation_id":"daf99f1d-3ef1-47e9-b666-abb418f71612","resolution":{"observed_at":"2026-08-05T20:21:09.429269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-05T20:21:08.269218Z","title":"S”, “E”, “*","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.269218Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:804dc7686e55f6b9218654b66a07c3801652925e2c66d6e2f8accbc903e8fcb1","observation_id":"fac393c8-196a-40fc-aff7-6f40df93604c","resolution":{"observed_at":"2026-08-05T20:21:08.269218Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 44 inbound Pith citation observations for arXiv:2508.10751."}