{"as_of":"2026-08-18T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbe3be4c0cdf124ef04d4f988d9ab8d02c3a4cfd36312dcacce55cc950edf13e","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:59:14.608524Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:16.022969Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-08-13T02:26:26.115035Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T15:45:09.730804Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2509.14234"},"observation_digest":"sha256:38bc3cafd30abd1acdac32ac56eee6c3b4ae5b43ff7f4ca25c095a86c3d117fc","observation_id":"aba17bf7-aa41-4982-be33-c74970665f6d","resolution":{"observed_at":"2026-05-18T15:46:34.147476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:4d1f03fb4a6c241aba5d41b716c608a61274dcc05c225118141ba68fe7ea2a85","observation_id":"93fc4f7e-c621-4a05-9be5-d73b16ef952b","resolution":{"observed_at":"2026-05-18T11:56:20.005263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-04T11:33:55.597960Z","title":"Outcome-based exploration for llm reasoning.arXiv preprint arXiv:2509.06941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04140","last_updated":"2026-07-01T03:04:05Z","snapshot_observed_at":"2026-08-18T01:18:57.115623Z","submitted_at":"2025-10-05T10:38:55Z","title":"Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:33:55.597960Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2510.04140"},"observation_digest":"sha256:3ebec13899fe84fcc3604be615d9f5e3fe7cf504d2687d7c703649f38f132ba6","observation_id":"d7bb58a8-660f-45d5-a3b7-88336b8b09c5","resolution":{"observed_at":"2026-08-04T11:33:55.597960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2510.08539","last_updated":"2026-05-07T17:44:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T17:53:41Z","title":"On the optimization dynamics of RLVR: Gradient gap and step size thresholds","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T08:34:36.543874Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2510.08539"},"observation_digest":"sha256:9bdb3ad08310f6fee0f598fabf68288719e1b9e73521f443db9f19e8890cdbed","observation_id":"47bb9eb1-86ab-484e-aecf-a73e478b05a3","resolution":{"observed_at":"2026-05-18T08:36:07.367130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-08-16T12:08:41.734241Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T07:37:12.501489Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2510.10150"},"observation_digest":"sha256:56a6945e905a7e09b77a91f96f966c2c568e7d95575839800eb225d3fc7aa441","observation_id":"f7150d8a-8e2d-4f20-95f4-cc2b6b036feb","resolution":{"observed_at":"2026-05-18T07:41:03.322829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-04T09:34:09.191451Z","title":"Outcome-based exploration for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-13T17:45:23.044567Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T09:34:09.191451Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2510.14807"},"observation_digest":"sha256:c714a9948d02a5ce222b67831b4ce6e15d79f3fcd3bfc78c3493c8095f4c8ddc","observation_id":"8365833d-3a81-4807-8ea1-032cec879060","resolution":{"observed_at":"2026-08-04T09:34:09.191451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-13T09:13:17.587485Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:332f7c1a62aa586dd52735ff03cf749aa1b59eb0fbcd416b53f175bba74f6233","observation_id":"7f61e66d-647e-4ac4-9bb8-3c2b623fc48a","resolution":{"observed_at":"2026-05-11T10:16:05.109966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-13T09:13:17.587485Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:c17530878209e1f71cd4a31131052e4700e552cc5fc45c4124b4f6bb45c3ee28","observation_id":"ec353b52-5182-4790-b97c-e9927c819038","resolution":{"observed_at":"2026-05-10T15:35:32.810462Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-16T04:10:01.421934Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:b2ce47eff9f500b219f732174d3a410496304f88417b1ab167688bc726858a81","observation_id":"bc8eb1c4-2005-4bcb-8c0a-d00995cf9619","resolution":{"observed_at":"2026-05-11T15:26:15.307690Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-08-14T02:21:03.214054Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:8e419bf370018e58f5059172ee561e95816cbe1c6c23a42200c1a23b1f448b77","observation_id":"3a0da2d4-b844-4ad7-966f-e3e171b50b9c","resolution":{"observed_at":"2026-05-12T04:21:22.471904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.11813","last_updated":"2026-05-12T09:06:08Z","snapshot_observed_at":"2026-08-11T14:18:21.534370Z","submitted_at":"2026-05-12T09:06:08Z","title":"Automated Reformulation of Robust Optimization via Memory-Augmented Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:15.799220Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.11813"},"observation_digest":"sha256:47393fe6ff84f08b7d60257ca0dbe9489d431459b2abd3deae3240fe882c7f6c","observation_id":"9d1c9fdd-fa13-48a5-8ad1-5b2657b1e058","resolution":{"observed_at":"2026-05-13T06:02:22.006754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-16T17:07:29.663216Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:c3ec35ddcac547ec092a907685bd911fe8a0e81839cc2aa4f38a0e69c08c3edd","observation_id":"15b83eb1-f291-473d-bba4-8dbfa2f28860","resolution":{"observed_at":"2026-05-20T05:33:04.041635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.28295","last_updated":"2026-05-27T10:46:01Z","snapshot_observed_at":"2026-08-15T08:43:34.455772Z","submitted_at":"2026-05-27T10:46:01Z","title":"Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T11:55:13.135221Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.28295"},"observation_digest":"sha256:8d3b88e7057f28a9a4c5a90af648ce40030a1c3831b0d51f656cacc64bd79276","observation_id":"6b0ad7f3-33f2-4b9e-a5a8-d3c0de4561b9","resolution":{"observed_at":"2026-06-29T12:03:24.374582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.03608","last_updated":"2026-06-02T13:11:09Z","snapshot_observed_at":"2026-08-07T00:11:41.078023Z","submitted_at":"2026-06-02T13:11:09Z","title":"Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T10:53:00.223228Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.03608"},"observation_digest":"sha256:f468ee9bbf7e3f6377292a57dae3f9bbc80e3bd7e23812e18381ae0f7ffa168e","observation_id":"5c2f4873-9732-44ca-92cd-a2ca7728e82b","resolution":{"observed_at":"2026-07-02T02:26:27.241826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-08-13T10:28:09.065513Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:7ba9fdc1b2d84fe0630ba4011202b98ec7a53d979c92850da75e09485703022e","observation_id":"cfbde808-e086-48c3-a262-22ea20a23115","resolution":{"observed_at":"2026-07-02T02:26:26.262089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3d28b3909bb6848272e136ad36f2f1390ba569a7567d0e4ea9110ff940c17780","observation_id":"04a2bc2c-32e2-40d3-9bb4-51b9022ca6e9","resolution":{"observed_at":"2026-07-02T12:06:56.413899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:aae4d574b68ab1ef3d6798cd5721bfb4a7451b55f567fd63daed3547922af0f1","observation_id":"a8126bf8-e979-40d1-a9e8-ef3344887b16","resolution":{"observed_at":"2026-07-02T12:16:56.999981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.09926","last_updated":"2026-06-07T14:06:20Z","snapshot_observed_at":"2026-08-14T20:29:32.920063Z","submitted_at":"2026-06-07T14:06:20Z","title":"Sample Where You Struggle: Sharpening Base Model Reasoning via Entropy-Guided Power Sampling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T18:48:37.544462Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.09926"},"observation_digest":"sha256:8e40243ac6803afe90740e1d7c7e27631b9e51805b449d2cf405cc2c37a1b900","observation_id":"d9b42875-8786-441d-b3f2-9035010c79b4","resolution":{"observed_at":"2026-07-02T22:37:25.535668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.10346","last_updated":"2026-06-09T02:55:12Z","snapshot_observed_at":"2026-08-07T09:56:59.243224Z","submitted_at":"2026-06-09T02:55:12Z","title":"Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:42.620290Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.10346"},"observation_digest":"sha256:04f3ca5bfdc496f8d713481319c4db125c8e9bd16dd29fead38d52b1214fa9d2","observation_id":"460713b0-7beb-42ad-921e-862a533385bf","resolution":{"observed_at":"2026-07-03T04:47:38.177041Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.27359","last_updated":"2026-06-25T17:58:02Z","snapshot_observed_at":"2026-08-08T13:26:53.952253Z","submitted_at":"2026-06-25T17:58:02Z","title":"When are likely answers right? On Sequence Probability and Correctness in LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T01:55:09.626278Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.27359"},"observation_digest":"sha256:c3abef9fae19347972ee3b4f13bb0c6361333f3b855c71c58b9dac5739280951","observation_id":"09bd86c5-8aec-4a16-8f1c-288d66fe7ce6","resolution":{"observed_at":"2026-07-04T15:09:54.111481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-07-14T17:39:27.292075Z","title":"Outcome-based exploration for LLM reasoning.arXiv preprint arXiv:2509.06941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09693","last_updated":"2026-06-19T12:36:23Z","snapshot_observed_at":"2026-08-15T23:52:47.483207Z","submitted_at":"2026-06-19T12:36:23Z","title":"Depth-Entropy Guided Sampling for Training-Free LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T17:39:27.292075Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2607.09693"},"observation_digest":"sha256:2c2cc846a7cbd4d33b3357d68b6ae7f9f989098987bbd0f9c9a389547a21c359","observation_id":"9ae9caf7-aae5-4d94-965c-b29c28373d27","resolution":{"observed_at":"2026-07-14T17:39:27.292075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-02T14:45:24.695248Z","title":"arXiv preprint arXiv:2509.06941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16205","last_updated":"2026-05-07T13:16:09Z","snapshot_observed_at":"2026-08-05T18:20:48.142001Z","submitted_at":"2026-05-07T13:16:09Z","title":"It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T14:45:24.695248Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2607.16205"},"observation_digest":"sha256:4af72c8e0d209b5784cd8e7e2dede1c05abd417c2317d9af9d4d2eeff3c6da92","observation_id":"a903df79-6c71-478c-beec-f75b19897c0a","resolution":{"observed_at":"2026-08-02T14:45:24.695248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-01T03:02:07.968437Z","title":"Outcome-based","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:07.968437Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:a2c8c0b612583d7eda28e11ee7782efb5d39cdd9f2807248fb7fe9d2f978e87f","observation_id":"48f9f5bd-daf5-4f16-aa10-d070be0d09a1","resolution":{"observed_at":"2026-08-01T03:02:07.968437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-04T15:25:49.290473Z","title":"Outcome-based","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-13T23:37:34.643451Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T15:25:49.290473Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:b2d54778cacdbe91e442b89adf5a819107a110014ef83671c779ee4caa9e7ac3","observation_id":"93ca818a-4402-4f00-a1c5-b184bffdb329","resolution":{"observed_at":"2026-08-04T15:25:49.290473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-07T00:15:16.022969Z","title":"Outcome-based","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-13T23:37:34.643451Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:16.022969Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:a5549b60372e84c0e734ee4cdd296e298096e0e1d58526732cd5ac0b9e6832de","observation_id":"0751ac2f-e549-4bfc-917f-80d0aead3b5c","resolution":{"observed_at":"2026-08-07T00:15:16.022969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06941/citation-record","integrity":"/paper/2509.06941/integrity","json":"/paper/2509.06941/citation-record.json","paper":"/paper/2509.06941"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:15.216442Z","title":"2:fort= 1,2,","venue":null,"work_id":"603548cb-5eab-45ce-b011-db3fe224c00e","year":1996},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.608524Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:9ade6d41e4b110aa943081ee281fc32afe49f8481994574744aa57fef00d1872","observation_id":"772784dd-2c91-4acc-97f1-975b46d09b0d","resolution":{"observed_at":"2026-08-04T22:59:15.222855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08495","last_updated":"2024-04-16T17:36:39Z","snapshot_observed_at":"2026-08-18T11:13:22.645268Z","submitted_at":"2024-04-12T14:25:49Z","title":"Dataset Reset Policy Optimization for RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08495","snapshot_observed_at":"2026-08-04T22:59:14.467898Z","title":"Dataset reset policy optimization for rlhf.arXiv preprint arXiv:2404.08495,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.467898Z"},"links":{"cited_paper":"/paper/2404.08495","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:b0a4b70a1a1feeedd4a3a10c179daebbb54d563ade26ad98a8e3816f619a9262","observation_id":"288c2f09-c7eb-49ea-adb0-38ff0434e55b","resolution":{"observed_at":"2026-08-04T22:59:14.467898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T22:59:14.473018Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models.arXiv preprint arXiv:2508.10751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.473018Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:0f5cd8e17880d9265f06ff21432bd9b1e6e3151ca887bc4eae7d45e31feee1ec","observation_id":"d36f566e-f01d-46dc-9179-90ccd70433a4","resolution":{"observed_at":"2026-08-04T22:59:14.473018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-08-16T12:42:28.642795Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-04T22:59:14.477484Z","title":"Reasoning with exploration: An entropy perspective.arXiv preprint arXiv:2506.14758,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.477484Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:0b8cf9a78f14e02561113b230862c387c3a5383770a6507f94b82ab90a3aafde","observation_id":"34ba54e2-b4ab-4ee0-846f-2aa771c9ce62","resolution":{"observed_at":"2026-08-04T22:59:14.477484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:14.481689Z","title":"Weight ensembling improves reasoning in language models.arXiv preprint arXiv:2504.10478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.481689Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:10321e283d5fbfca001d2e358473f47f63bf394db8e1915e3e36398d1c8d9ee4","observation_id":"3ce41058-e781-4281-a027-09c512726caa","resolution":{"observed_at":"2026-08-04T22:59:14.481689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13487","last_updated":"2023-07-11T16:47:42Z","snapshot_observed_at":"2026-08-18T13:55:54.042604Z","submitted_at":"2021-12-27T02:53:44Z","title":"The Statistical Complexity of Interactive Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13487","snapshot_observed_at":"2026-08-04T22:59:14.485864Z","title":"The statistical complexity of interactive decision making.arXiv:2112.13487,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.485864Z"},"links":{"cited_paper":"/paper/2112.13487","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:b27ba8ab8f2d5b44d9eab6b604436d003cb84e3dbfb170e1ce594ec56b904a19","observation_id":"4e0d72bb-28eb-42d3-b440-06304a84dbfb","resolution":{"observed_at":"2026-08-04T22:59:14.485864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T22:59:14.494351Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.494351Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:87ead6ec20dc15a7e0fb64b457c20399cedcc6c8958564f4388a926767426cde","observation_id":"cc6109ad-08bf-4aef-a875-997ebe7deb32","resolution":{"observed_at":"2026-08-04T22:59:14.494351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T22:59:14.498713Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.498713Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:b81b571be216c238cf1864a4e7b4ffb5a82ed647b36c87426f4fc0a4116567b0","observation_id":"a506f41a-267b-49c8-a223-5e200306f839","resolution":{"observed_at":"2026-08-04T22:59:14.498713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T22:59:14.503377Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.503377Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:16f8215b23cd4ebe9c19e3a9c39e96c0905a7b9b6f487f72d9bff0fdffeffae7","observation_id":"359e9c1c-7d9d-440f-96fe-bbdbc4be1d7a","resolution":{"observed_at":"2026-08-04T22:59:14.503377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-08-14T15:51:49.712613Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-04T22:59:14.507748Z","title":"Understanding the effects of rlhf on llm generalisation and diversity.arXiv preprint arXiv:2310.06452,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.507748Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:94238e910eae6336f31ef84689bd9f305a6af871bb4ca2e4d0838fc9786c3e35","observation_id":"94662f91-9583-418f-89b4-06d067697620","resolution":{"observed_at":"2026-08-04T22:59:14.507748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-17T08:23:33.538751Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-08-04T22:59:14.516795Z","title":"Jointly reinforcing diversity and quality in language model generations.arXiv preprint arXiv:2509.02534,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.516795Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:95d923c5a7250f03f14e22802d1209bc3cf9b0bfaf4f2ab431b4a7b53a4ae228","observation_id":"2c1a1a68-f682-4f72-ab3e-c7d1d3067f65","resolution":{"observed_at":"2026-08-04T22:59:14.516795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:15.233394Z","title":"Approximating kl divergence, 2020.URL http://joschu","venue":null,"work_id":"3c743de4-e857-481a-8f7f-3f542e1ea5d5","year":2020},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.530110Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:63d252b2652e27d0ee50c64e4f8ff41da8b4e9888d2bf3726fad85146fa99123","observation_id":"77a22718-0a52-4f80-9d4b-b5cd772f1e00","resolution":{"observed_at":"2026-08-04T22:59:15.239298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:14.538465Z","title":"Can large reasoning models self-train?arXiv preprint arXiv:2505.21444,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.538465Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:c49d5ca4a239944a78d1bf40f4d019b894b63d1b7e9cae77fabc65c749657570","observation_id":"498f03d7-ccc7-4751-8b18-066d62061239","resolution":{"observed_at":"2026-08-04T22:59:14.538465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T22:59:14.543111Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.543111Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:dab5dfdda79b66c64d1dbfa64755d4d9250e31333e38863217ae88b1c35c5d47","observation_id":"26c7fea0-23d2-4572-910d-e602d65a79a6","resolution":{"observed_at":"2026-08-04T22:59:14.543111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T22:59:14.547422Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.547422Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:d3568506d7a127d96451145ade26671918fd8e157d76bae45cffc39ab80c9607","observation_id":"2daa3bfb-6428-44ca-a5e3-92d2dcbcebee","resolution":{"observed_at":"2026-08-04T22:59:14.547422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-04T22:59:14.551823Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.551823Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:0ca0206d72ca173eb6d6441373551de032ee1b845767ffcef4d3483e277d0992","observation_id":"ae28b6aa-0078-4384-a72b-596394671fad","resolution":{"observed_at":"2026-08-04T22:59:14.551823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02674","last_updated":"2025-02-25T16:59:11Z","snapshot_observed_at":"2026-08-14T20:58:55.959220Z","submitted_at":"2024-12-03T18:47:26Z","title":"Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02674","snapshot_observed_at":"2026-08-04T22:59:14.556101Z","title":"The importance of online data: Understanding preference fine-tuning via coverage.Advances in Neural Information Processing Systems, 37:12243–12270, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.556101Z"},"links":{"cited_paper":"/paper/2412.02674","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:5916e981e2a91004c527eb189453db279d87fd6ace639f672bd8ea44fa3acc26","observation_id":"73d87d62-3600-436e-8f4c-b412c9fef2d6","resolution":{"observed_at":"2026-08-04T22:59:14.556101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09477","last_updated":"2025-06-11T07:43:33Z","snapshot_observed_at":"2026-08-16T14:29:03.952266Z","submitted_at":"2025-06-11T07:43:33Z","title":"On a few pitfalls in KL divergence gradient estimation for RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09477","snapshot_observed_at":"2026-08-04T22:59:14.560552Z","title":"On a few pitfalls in kl divergence gradient estimation for rl.arXiv preprint arXiv:2506.09477,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.560552Z"},"links":{"cited_paper":"/paper/2506.09477","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:061b8b47d64eac2fea88940aa8471d485b0a793c9eb37c721518a1a8d7a89f7d","observation_id":"fb93e9e2-8fda-416f-af68-8a2d11cd188d","resolution":{"observed_at":"2026-08-04T22:59:14.560552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-18T00:54:25.406099Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-04T22:59:14.565055Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.565055Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:47941f666c640e571f2010f6e4b7da58a306211cc6f9ae0416983dbc57fd11b1","observation_id":"0d78bad3-7a1d-4923-8247-095ae001384d","resolution":{"observed_at":"2026-08-04T22:59:14.565055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:14.569218Z","title":"The invisible leash: Why rlvr may not escape its origin.arXiv preprint arXiv:2507.14843,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.569218Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:fdf30076266afc2369e3eec28d74c62eaa99064285b56df5ab293f8b983febef","observation_id":"ab716baf-2fff-4450-87df-83fb63bd4183","resolution":{"observed_at":"2026-08-04T22:59:14.569218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-08-16T13:47:19.929213Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-04T22:59:14.573190Z","title":"Exploratory preference optimization: Harnessing implicit q*-approximation for sample-efficient rlhf.arXiv preprint arXiv:2405.21046,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.573190Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:dca1c5d64ed874d7f34158dee5981472145e15d152e151a238bae16f8828f774","observation_id":"ee64cf97-aa98-409a-94f1-1a11ad286fef","resolution":{"observed_at":"2026-08-04T22:59:14.573190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-17T14:40:56.015819Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-04T22:59:14.577593Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint.arXiv preprint arXiv:2312.11456,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.577593Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:bf15a80a1b3ed9bce706f541203943736c349846a92abee86be4d9aff9cf4e19","observation_id":"ca620d9e-6f09-4fc7-bfbe-5a69903cbd8f","resolution":{"observed_at":"2026-08-04T22:59:14.577593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T22:59:14.585858Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.585858Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:cc02cd240654a8478879fc260ba7be58d7d3d03e28596ed44f9b83e2d425b2d0","observation_id":"635fd568-f897-4a7b-80ec-6f02b0858d77","resolution":{"observed_at":"2026-08-04T22:59:14.585858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-04T22:59:14.590415Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.590415Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:d06d8e98efa78d8343b19e8a5b66397f401295a5168b1e1f70e428874a9bfacf","observation_id":"ac98f467-6180-45da-b120-1910ac200a53","resolution":{"observed_at":"2026-08-04T22:59:14.590415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18949","last_updated":"2025-05-25T02:52:35Z","snapshot_observed_at":"2026-08-13T21:15:10.734752Z","submitted_at":"2025-05-25T02:52:35Z","title":"The Price of Format: Diversity Collapse in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18949","snapshot_observed_at":"2026-08-04T22:59:14.595531Z","title":"The price of format: Diversity collapse in llms.arXiv preprint arXiv:2505.18949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.595531Z"},"links":{"cited_paper":"/paper/2505.18949","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:ce71199e72850b8bd7f005133af927d3fc9e13698c55d8a9d27a07c2352d80be","observation_id":"02725c34-f758-487b-923c-88331c46836e","resolution":{"observed_at":"2026-08-04T22:59:14.595531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-08-16T13:48:06.116170Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-08-04T22:59:14.599880Z","title":"Self-exploring language models: Active preference elicitation for online alignment.arXiv preprint arXiv:2405.19332, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.599880Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:bb8175769cdcfb76eb04e0c4b207e8c3845a2cc22cc5cb94a3dae0b8e82a259c","observation_id":"07e30d42-0401-4a3e-98d7-9f776f3d8e3e","resolution":{"observed_at":"2026-08-04T22:59:14.599880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-18T16:49:41.929152Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-04T22:59:14.604039Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.604039Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:c88244038186a3381c2011adf40b361590e7280d5a2fd9b4fc8c98f6a7c6776a","observation_id":"14b2af2a-9784-420d-848f-0382d14a4838","resolution":{"observed_at":"2026-08-04T22:59:14.604039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:14.521058Z","title":"Optimistically optimistic exploration for provably efficient infinite- horizon reinforcement and imitation learning.arXiv preprint arXiv:2502.13900,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.521058Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:9bee7df94166a75247e7b59dc4ac0e512f39d573f9cff098f20eceeb30cae975","observation_id":"923ed1ad-05bf-484b-b01e-fd396b1f5ffd","resolution":{"observed_at":"2026-08-04T22:59:14.521058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-04T22:59:14.458521Z","title":"Exploration by random network distillation.arXiv preprint arXiv:1810.12894,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.458521Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:d7b3b5b9416ca589a442ee21c08fb76beea52d8a52d1967a46281f413f563e89","observation_id":"d6b198d2-3e16-4493-851b-f3f8ea1ea061","resolution":{"observed_at":"2026-08-04T22:59:14.458521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18101","last_updated":"2025-05-22T17:50:19Z","snapshot_observed_at":"2026-08-18T05:23:43.970820Z","submitted_at":"2025-01-30T02:47:41Z","title":"Diverse Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18101","snapshot_observed_at":"2026-08-04T22:59:14.512402Z","title":"Diverse preference optimization.arXiv preprint arXiv:2501.18101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.512402Z"},"links":{"cited_paper":"/paper/2501.18101","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:38ee8fce98be3165f4b12673b1a79151a1ffdc77ff4297d9bae015849e2769c3","observation_id":"8590e1fa-3675-4041-bd44-43f2f9dd1d6e","resolution":{"observed_at":"2026-08-04T22:59:14.512402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19320","last_updated":"2025-02-19T00:51:58Z","snapshot_observed_at":"2026-08-16T13:48:04.333875Z","submitted_at":"2024-05-29T17:51:42Z","title":"Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19320","snapshot_observed_at":"2026-08-04T22:59:14.463200Z","title":"Value-incentivized preference optimization: A unified approach to online and offline rlhf.arXiv preprint arXiv:2405.19320,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.463200Z"},"links":{"cited_paper":"/paper/2405.19320","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:b79051a6334358d9bf0cf3b64f7f91ffd3cc158ee9a4e10f1b33289ca1e00307","observation_id":"e2c308a8-ab1d-4242-83f7-f1ad2fa216db","resolution":{"observed_at":"2026-08-04T22:59:14.463200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T22:59:14.581505Z","title":"Qwen2.5 technical report.ArXiv, abs/2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.581505Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:41259f7ffb466d609191c3e1593b210fe2d2b6e41c6afc2138dbb13f0c4f6666","observation_id":"5cc9057c-9b41-48ca-8c6c-47c9a99027ba","resolution":{"observed_at":"2026-08-04T22:59:14.581505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-18T17:39:46.587540Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-04T22:59:14.534182Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms.arXiv preprint arXiv:2506.09026,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.534182Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:19ff1ea1da1a0f9a1fe4f4ee61f1122f61b7e2e36b102ae26a145d0d626bf6f6","observation_id":"62e79bd9-5de4-4b91-b579-44a002b56daf","resolution":{"observed_at":"2026-08-04T22:59:14.534182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:14.490216Z","title":"Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.490216Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:a753d9fe3987453b80b1a002898d74f38eab2b79c2c210dfa6b902f73f95f395","observation_id":"4927a9db-db97-43b7-bc2c-0629bb70414b","resolution":{"observed_at":"2026-08-04T22:59:14.490216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:15.250001Z","title":"Attributing mode collapse in the fine-tuning of large language models","venue":null,"work_id":"44bd4541-55f3-48de-83e2-fdca64ecba6b","year":2024},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.525912Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:42af6e9348295b5a42b763d7e94a28a75ff91034ce7a9b663afdd471c345f1f6","observation_id":"d04a1e4f-1a34-405c-bc14-f9f4ca59e70d","resolution":{"observed_at":"2026-08-04T22:59:15.254676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:59:14.443923Z","title":"Asymmetric rein- force for off-policy reinforcement learning: Balancing positive and negative rewards.arXiv preprint arXiv:2506.20520,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.443923Z"},"links":{"citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:70d2105b6adf8cd5629904c172cc54d3c52673d97a872837cc80bffb95b3e93b","observation_id":"964e69e0-4b1d-4850-ae05-6aa530a6b73f","resolution":{"observed_at":"2026-08-04T22:59:14.443923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-08-17T20:21:27.504758Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12735","snapshot_observed_at":"2026-08-04T22:59:14.448812Z","title":"Online preference alignment for language models via count-based exploration.arXiv preprint arXiv:2501.12735,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.448812Z"},"links":{"cited_paper":"/paper/2501.12735","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:f6cba3f00a32cd431a7f12e83943ee8ec5edcdeec1b7325da32455900d7822e6","observation_id":"a61d8773-626d-46fe-b3bf-f7fa28628346","resolution":{"observed_at":"2026-08-04T22:59:14.448812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T22:59:14.454002Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.454002Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:f7bf6e25226cd12d626892299353a8c2403c001822894e8d07303dfc47d82ba6","observation_id":"b385f625-764e-405a-b34c-728dee68553d","resolution":{"observed_at":"2026-08-04T22:59:14.454002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 25 inbound Pith citation observations for arXiv:2509.06941."}