{"as_of":"2026-08-09T14:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d3fa0e35797d462cf249e2ef870594a565a82dba8a914862c87f05d56512416","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:21:57.143016Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:49:54.921367Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2606.06080 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-04T11:23:41.061756Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:9810360841d1091c03cd2adc472d5d2f9b5e1d44bf9cf8adc1e819c60e32c4ab","observation_id":"2ab39a61-7fdc-44b9-ba0c-266f239da232","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-08-02T00:41:12.582293Z","title":"On advantage estimates for Max@K policy gradients.arXiv preprint arXiv:2606.06080, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14962","last_updated":"2026-07-16T13:14:21Z","snapshot_observed_at":"2026-08-09T09:38:01.959634Z","submitted_at":"2026-07-16T13:14:21Z","title":"Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:12.582293Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2607.14962"},"observation_digest":"sha256:22234a10d1b69c5cedd3f5d176ef92e98648ed617824e16f317252b0661c6339","observation_id":"d3a013a1-75d5-4f88-a672-5f78cae46762","resolution":{"observed_at":"2026-08-02T00:41:12.582293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-08-04T00:49:54.921367Z","title":"2606.06080 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00296","last_updated":"2026-07-31T21:11:48Z","snapshot_observed_at":"2026-08-08T23:55:30.721954Z","submitted_at":"2026-07-31T21:11:48Z","title":"Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T00:49:54.921367Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2608.00296"},"observation_digest":"sha256:39c69361f1114e109052893286a59364f35eb703edb89a7908c418ee52db3e9a","observation_id":"006768af-557e-43b9-92c8-62ce1a4519a5","resolution":{"observed_at":"2026-08-04T00:49:54.921367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.06080/citation-record","integrity":"/paper/2606.06080/integrity","json":"/paper/2606.06080/citation-record.json","paper":"/paper/2606.06080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Finite-time analysis of the multiarmed bandit problem.Machine learning, 47(2):235–256, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:db3049e6118bec3b468dce93ef55634a730957745ff00f59c9ceaf249c0a095e","observation_id":"e9d87534-3b86-49b4-9d36-52120868d367","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:56.995100Z","title":"The best of n worlds: Aligning reinforcement learning with best-of-n sampling via max@ k optimisation","venue":null,"work_id":"92afd1d0-76d7-404f-bb98-a521406f2c18","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:e26145c5d8c7f5aa3bea8746fec80ea8a994a8062f0ee0aa2f0760e8c59be71e","observation_id":"543eebbd-3c98-410a-ac7e-bfae8c3bea4e","resolution":{"observed_at":"2026-07-02T12:06:56.456387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-08-08T07:39:21.795122Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"cited_work":{"arxiv_id":"2501.12735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12735","snapshot_observed_at":"2026-07-03T04:17:37.298243Z","title":"arXiv preprint arXiv:2501.12735 , year=","venue":null,"work_id":"ed782cfe-3240-4098-b5b8-77340b192a69","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2501.12735","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:6da40d8bcc9abbf317998ed2bfe689246037dbcf457126e6bf3d4bd1e5e757f8","observation_id":"7e4c3140-62f9-4b08-b63f-b3e808a90c04","resolution":{"observed_at":"2026-07-02T12:06:56.459065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:57.011864Z","title":"Post-training as reweighting: A stochastic view of reasoning trajectories in language models","venue":null,"work_id":"8c3af321-88c8-423e-84f7-acaa90a08cbb","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:650004db217992b770cb0ab692a72aec9af95fe7cc06d8e993a8c772f7d25543","observation_id":"f0ec27f7-9f27-4d97-b816-ae168c473926","resolution":{"observed_at":"2026-07-02T12:16:56.591850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":"1810.12894","doi":"10.48550/arxiv.1810.12894","metadata_source":"pith","pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration by Random Network Distillation","venue":"cs.LG","work_id":"5a87fef6-96e2-4d5b-91ec-1a7c9a43cab9","year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f2937430cc6441d15b29c34de4d862fe5c68536d0d9578c2a92ee7ab0371e185","observation_id":"2d3a9e82-3707-4987-b5c4-6cf763edcbcd","resolution":{"observed_at":"2026-07-02T12:06:56.450761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:38:56.018423Z","title":"arXiv preprint arXiv:2510.15020 , year=","venue":null,"work_id":"6a468d06-b0b2-4d32-85fd-004b5cb11cc7","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f13589f39cc6f2b6ffc0220bac923be00d2eae66c82782ce7bf1bbe9792cfd83","observation_id":"35de7610-04bb-4d37-98cb-04f19d3a0d84","resolution":{"observed_at":"2026-07-02T12:06:56.385892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:0548013f3bc3c0d7e85d5b250dd735fd3ca774a385776c3d1e1448b5113d09fd","observation_id":"619fa3af-3bf9-43b9-b1cd-5cbf31564b8a","resolution":{"observed_at":"2026-07-02T12:16:56.588901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f8695bdad3a482cab05ac872fa3ed198365188c430505c7a98c563f1eca0fa5d","observation_id":"b02f5bbd-79a9-4cf7-8857-b3f6bccb225e","resolution":{"observed_at":"2026-07-02T12:06:56.383237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i36.40290","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with exploration: An entropy perspective","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"1dca8017-ef26-4784-bb13-14697377df46","year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5eb89614de3e8d5a4b9d6f1e8c1ccc2839337dc837439bc30b9e9a047115d6e2","observation_id":"eb6b85f0-3116-4476-ae8d-a83788160ada","resolution":{"observed_at":"2026-06-28T02:31:30.232165Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T10:23:20.511749+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T10:23:20.511749+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:821752bdfe319ceb80561379a8ba603d848e80242a605cb6c324f7229c70d3a3","observation_id":"02b542aa-6423-49ae-b28c-45706bdeecf5","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Beyond variance reduction: Understanding the true impact of baselines on policy optimization","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9dcb253771bbd28aa2ce287257721ce593caae02cf9bbea0e3f7c19798764fba","observation_id":"42035913-4b5e-4044-92b9-ac0aa32f408b","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:0d7081b987f644f8bc0ee5e3833765908448d05ef538481768bb47fa1c2b3d04","observation_id":"245a53bb-ddc2-425b-b236-3491c3f5ee93","resolution":{"observed_at":"2026-07-02T12:06:56.425930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c94104125c0c1ea521491e029ef528b46eaa4831f70159313910803978537221","observation_id":"6b214efe-25b4-4ae3-833c-fbbe217175a7","resolution":{"observed_at":"2026-07-02T12:16:56.585783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Weight ensembling improves reasoning in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:55171aa7473cbf82ee2cb1a6b5dba66a85e009dbfcf1e5c0991e5cfd6e0aee3e","observation_id":"49c68fd0-b753-4d53-8b62-5e7babe84c66","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.186056Z","title":"arXiv preprint arXiv:2505.17621 , year=","venue":null,"work_id":"035ff294-c5e5-4e88-ae7a-0df158e76e15","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9ad9a95b7a9899330a8c10565b085e8bd334ac3aa848e731329d6ced30b73ed6","observation_id":"3c8b4829-1361-4583-beb0-91682e013424","resolution":{"observed_at":"2026-07-02T12:06:56.461761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:608089a5e296ea2f647fc7d51669c2ca61034c5e3a6cec17bb65636d58117006","observation_id":"fd41b64d-5172-4cca-b828-31ffe3f6ec93","resolution":{"observed_at":"2026-07-02T12:06:56.443870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Variance reduction techniques for gradient estimates in reinforcement learning.Journal of Machine Learning Research, 5(Nov): 1471–1530, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:7d756a071d15bfac81e57040de11771cf1eaafdbcf0966ed6822deace35952c6","observation_id":"fdccaf20-1b01-4608-ae6f-ea37d8c6fe86","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05176","last_updated":"2016-02-25T20:36:21Z","snapshot_observed_at":"2026-07-06T04:36:42.881459Z","submitted_at":"2015-11-16T21:08:25Z","title":"MuProp: Unbiased Backpropagation for Stochastic Neural Networks","version":3},"cited_work":{"arxiv_id":"1511.05176","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.05176","snapshot_observed_at":"2026-07-02T12:06:56.447450Z","title":"MuProp: Unbiased Backpropagation for Stochastic Neural Networks","venue":"cs.LG","work_id":"6b06a0b4-c215-47db-b876-9330312b1194","year":2015},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1511.05176","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:fec9a0dac6bc116fd1d018391d8dcbcbd23cfc63f484e65685f42f2b8cc60357","observation_id":"ea11b413-dd9c-4a29-b2db-4a27d8b283c9","resolution":{"observed_at":"2026-07-02T12:06:56.448633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:a203800c8a1b1dc1566b852f94b48050278b8ce79e9f7ed8383f11b0d4318063","observation_id":"30aa64ea-53b9-42ce-bbe1-0fb09374700d","resolution":{"observed_at":"2026-07-02T12:06:56.426380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-08-08T15:13:20.527982Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"cited_work":{"arxiv_id":"2506.02355","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02355","snapshot_observed_at":"2026-07-03T20:38:55.917128Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening","venue":null,"work_id":"349bfcd5-c482-404a-961a-599b6e5813d9","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.02355","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b876d35c247bedd7b2614fa5c76324307921cc5bc39544decc6fc5badaadfb24","observation_id":"83954b2f-cd48-4257-adb2-0de7f8459dc4","resolution":{"observed_at":"2026-07-02T12:06:56.428956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:840eb84ef4989234e4e82dea3ef16a8f7a033d5c563c49506ebd4e8a39d6d543","observation_id":"8a335aa8-db5f-4693-82ea-ad6329f24100","resolution":{"observed_at":"2026-07-02T12:06:56.433525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"A class of statistics with asymptotically normal distribution","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:51ae77bdebf49bdaccbf7f64b6822952a1ae25dd335bab6d10c4c620b4b7db02","observation_id":"c51556c9-30e1-4ed6-bf1e-22f81ba35f0b","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23629","last_updated":"2026-05-07T02:29:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T04:10:37Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","version":3},"cited_work":{"arxiv_id":"2509.23629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23629","snapshot_observed_at":"2026-07-10T11:37:03.356545Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","venue":"cs.AI","work_id":"82ef2feb-9982-4d37-bac4-f9efd152cbce","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2509.23629","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:a87583a1dcc959775561284d226db2048c761c78b13f84ef097f9e70b8f314b5","observation_id":"5aca0c07-0b64-4efe-a780-00e35b22a508","resolution":{"observed_at":"2026-07-02T12:06:56.448464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.299960Z","title":"arXiv preprint arXiv:2509.25133 , year=","venue":null,"work_id":"27ca51ae-e57f-4f13-9b0c-155064ec727b","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5e611b9d2eabc99c43b0951a89ffbe3c0cff3f307ea4b7df9c16eba2f1d4f65f","observation_id":"64be959f-a0ba-4b75-b248-ea764785db81","resolution":{"observed_at":"2026-07-02T12:06:56.421477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:d8d859c006bf7d444a99d28170097368672031f2ed4043b388a0ea088ef09a0b","observation_id":"5bab3412-5500-4e49-a263-ee8e2e57402a","resolution":{"observed_at":"2026-07-02T12:06:56.431368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Emergence of exploration in policy gradient reinforcement learning via resetting, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5a9753942056b7c9415e1b814d3e5e55e37f3794a0be9ccb75b0d43c127f4065","observation_id":"f8241fdf-c3de-44fd-9bfd-1bdff93c5bd8","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Christopher Wilhelm, Luca Soldaini, Noah A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:cc4ceb854ee90e4c7a3ac9972f1f05ea24dd90ce2ae7bd9e2ffdad64a0c02881","observation_id":"f7c6c964-53e6-483f-96f9-7b9a743c4b83","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9d5c9684407d933e26b11b44f9ba104048ef4eb57de62060d39e77c8ae443fea","observation_id":"0a9baef8-00ab-4443-8d09-a9c68b841d2c","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-05T11:30:06.956863Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:01d5b152d569e25570287d301895245f61964550585d6a693f423c69abb66aed","observation_id":"566591fd-f894-43e7-9ac0-cc2a9b78f151","resolution":{"observed_at":"2026-07-02T12:06:56.451211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.372600Z","title":"Can llms guide their own exploration? gradient-guided reinforcement learning for llm reasoning","venue":null,"work_id":"2a20b1ce-d30e-4599-9057-c9f6932478b7","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:436c64c955b0d4079cd46c201d2d759c13458090f3cf76465a6ab3183f76e51a","observation_id":"dee092f5-63ba-44e7-b934-48b10a46b4f9","resolution":{"observed_at":"2026-07-02T12:06:56.453670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:e86b58959468d850c738e1f1c57a7f1a7cb458d9dd44c12eff7efab6eb396109","observation_id":"70c5232d-eba7-4788-9178-9635a7407d29","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"RL squeezes, SFT expands: A comparative study of reasoning LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:ee2d7bd17f73048a100451b994bd762425e7580d724e8740648a788f767e167c","observation_id":"740d59f0-ac71-408a-b8e8-e6c15fab080c","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"The role of baselines in policy gradient optimization.Advances in Neural Information Processing Systems, 35:17818–17830, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c126d4ae7959825a1be2cf37302add94173d3f6450de9db91b8aedee6d8ad883","observation_id":"ac8ec50a-cae2-4cbe-b7dd-50064f44a405","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Variational inference for monte carlo objectives","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9b7d4f3069c9da3da135af2c1b2630178872a6373188b53f9075671f8f4f47f9","observation_id":"fdb5b8d2-32fc-4a8e-a7eb-a6c7ad61f758","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Asynchronous methods for deep reinforce- ment learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:924597943f8f16721f59eb4a7982539ee9382490ec75dc654754c33a7055b3db","observation_id":"a487ccb8-4605-4075-bec3-882270cf3202","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Emergence of exploration in policy gradient reinforcement learning via retrying","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:a8ff6eca2e6b59e1e4cc9de4cb381228f56fed12d9b605fc2af7686d291d6649","observation_id":"c3ff4086-40b9-4c50-8d35-d67f261fd71f","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3069a0daac55e5007db77ccda38008f5c5c6282308c7efbe406671964cc214d4","observation_id":"aaa432fd-26ee-46e7-90a0-daaa390eefc8","resolution":{"observed_at":"2026-07-02T12:06:56.440986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Total stochastic gradient algorithms and applications in reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:d6187437152859d141caab4b2c06dd73681350be89b8749b1adb3a44700000fb","observation_id":"068f44fa-383d-40bf-abad-a46d3f9217a8","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"A unified view of likelihood ratio and reparameterization gradients","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:596c7c0ef631f87f0100fedd6ff7b6b059ecdf481d72cd200a89b3e264425229","observation_id":"7cc8d450-5098-41bb-ba1a-81b35467b508","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"PIPPS: Flexible model- based policy search robust to the curse of chaos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:25a4ca2d7014b572f131be59bc9b128934ddd0a31849267be3f456a6166e3e00","observation_id":"5f33d517-d2b8-42e5-bed0-3e293bcb355f","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"cited_work":{"arxiv_id":"2510.14807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14807","snapshot_observed_at":"2026-07-03T21:08:57.699582Z","title":"Simko: Simple pass@ k policy optimization","venue":"cs.AI","work_id":"29212f52-a9c4-4214-85da-144ddfcc8042","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2510.14807","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:dcd4364941b83ebbc950c96e120c2191c5abf4815eade3705c3411e6cb174aff","observation_id":"ccc58204-e901-4294-bf34-6fc3d3bb8c40","resolution":{"observed_at":"2026-07-02T12:06:56.431196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Reinforcement learning of motor skills with policy gradients","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f97c9f70047c51314f17d3f1cebaa6cb20977f016d7d83505be2d0cde47661d1","observation_id":"80b04d8c-869a-437f-896e-e1f698062db6","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f019fa2b2cda5c08e4d4c95ae985c9c399c3e3d6266a826860faba3149cbefa8","observation_id":"feda5041-2619-462f-bc64-efacbe01732e","resolution":{"observed_at":"2026-07-02T12:06:56.406133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-09T06:45:47.107738Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5c2d2e7b8c37470c2a1b95504029910ded9e641af41efffa0b91739efb81f61b","observation_id":"978bf51c-3054-476a-bfff-6e3746dd43dd","resolution":{"observed_at":"2026-07-02T12:06:56.433620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-07T21:53:41.208900Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":"2504.04022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-07-05T10:20:57.237283Z","title":"Rethinking reflection in pre- training.arXiv preprint arXiv:2504.04022","venue":null,"work_id":"dd1b4e9d-9546-4ae2-80c3-4c45b9cf7b90","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:a0fd5ad70e677537332706767bbfc3d7e1ba18ddae5df41ef0af7932e36a32e9","observation_id":"283fed06-b34b-4ef7-9aa5-28b5431b5e8f","resolution":{"observed_at":"2026-07-02T12:06:56.418746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:11e22d796adb8354c1e13d46dacaaef324e5e8b3086685827f1632267518b9e7","observation_id":"9c98f150-8c58-49ba-a853-dd94deba054c","resolution":{"observed_at":"2026-07-02T12:06:56.436184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"On entropy control in LLM-RL algorithms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:0ac241f4213b03f42e6a39e25a85f8eb2010e5a9a3494579048dde8beca7e7aa","observation_id":"a6ffc73c-cf59-4104-8cc2-e6ef512812c5","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:86139f85217acd8bc2683266d88b1d64c3c82a598355327df6d053d3f1cc08f2","observation_id":"5f9f6c87-a403-485b-b3d9-44f4ae530620","resolution":{"observed_at":"2026-07-02T12:06:56.443553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:106344fe75259a1ce79cb06b1d08f158b0bde1a654531b33764616d3fd0634e4","observation_id":"04a2bc2c-32e2-40d3-9bb4-51b9022ca6e9","resolution":{"observed_at":"2026-07-02T12:06:56.413899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Kakade, Dean Foster, and Udaya Ghai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b2e893e7a9fb0025d02a98c924d288a4e5ced6aa64ee6a6c917b88baea68263d","observation_id":"f3ea7472-d129-4b72-9155-eedbf8a6b1eb","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Optimizing language models for inference time objectives using reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:dd6a433a66f16e443e9ad6c7967d0d71d4277eb61d5d4049d8979cb0399bdbae","observation_id":"56ae5afe-71fd-4cb8-be8d-debda028fceb","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Rebar: Low-variance, unbiased gradient estimates for discrete latent variable models.Advances in Neural Information Processing Systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:96a6c57eb883ea729b2a82b436252bb340b3b975cfe23585dc0e31db82afc284","observation_id":"c9bdda4e-318e-41e5-a871-8b21caaf1d0a","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f9b7e48a1d7319fccfcea0bc6448b3c452ce68a024e39f48da91deb67d281833","observation_id":"a4c882a5-141e-4c30-8a1d-7f1111eae931","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Pass@K policy optimization: Solving harder reinforcement learning problems.Advances in Neural Information Processing Systems, 38: 152416–152445, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:bc637b59fdeb1f337cfbaa0ffa7ec6f2800c05d2e753e1c510f035a40aea1f29","observation_id":"04c33fe3-4eb1-414f-b0aa-153b880ba2e8","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-09T13:10:58.433740Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:74dc3abc6d1ca8e137a24ee04e974bf22fbd9ef7ddf008e94dff0332b9ded9fe","observation_id":"669a75df-30e2-4d7a-831d-0b8a5667faa5","resolution":{"observed_at":"2026-07-02T12:06:56.418404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.2315","last_updated":"2013-01-10T16:26:53Z","snapshot_observed_at":"2026-08-08T19:30:35.157549Z","submitted_at":"2013-01-10T16:26:53Z","title":"The Optimal Reward Baseline for Gradient-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1301.2315","doi":null,"metadata_source":"pith","pith_arxiv_id":"1301.2315","snapshot_observed_at":"2026-07-02T12:06:56.444841Z","title":"The Optimal Reward Baseline for Gradient-Based Reinforcement Learning","venue":"cs.LG","work_id":"648dcf97-3314-429a-8c68-6b3dd556ccea","year":2013},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1301.2315","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:548219e4f8285a96d410538d990ba402c651009f003c18120bf285aacf1c0bff","observation_id":"6f6f9517-3815-4785-b5b3-3c9765a0d875","resolution":{"observed_at":"2026-07-02T12:06:56.445997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b7d0841c9053b896e307e81b38b4801ac325609fe73cd5542e07f0cedfe359fc","observation_id":"195d58b3-f851-4598-8de3-4768f6b75741","resolution":{"observed_at":"2026-07-02T12:06:56.454152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.Machine Learning, 8(3):229–256, May 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:de73a1ebf0831cdab77aba6f6c44f3bee894286b124eb2bef7639ae2af75b1a4","observation_id":"59aaf811-b77f-4c93-81dc-59f67d2d8af0","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07246","last_updated":"2018-03-20T03:52:04Z","snapshot_observed_at":"2026-08-04T02:55:23.565483Z","submitted_at":"2018-03-20T03:52:04Z","title":"Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines","version":1},"cited_work":{"arxiv_id":"1803.07246","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.07246","snapshot_observed_at":"2026-07-02T12:06:56.457970Z","title":"Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines","venue":"cs.LG","work_id":"744349fa-8fea-4267-b41a-828de09ed0eb","year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1803.07246","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f6435bcdc09c84d62831c5ade9f006dcc3e1bfbe9506a3c351792c3b1297d6dd","observation_id":"8792cc16-08d9-48c6-9f54-e21cc4766a3a","resolution":{"observed_at":"2026-07-02T12:06:56.459203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.14843","doi":"10.48550/arxiv.2507.14843","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The invisible leash: Why rlvr may or may not escape its origin","venue":"arXiv (Cornell University)","work_id":"71f17397-1cd4-4f68-ab1d-e91bb5f5953d","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f24c3bef3f8aab915ad67770050fc025dada1bc6c16bddc26b872445df3d00b5","observation_id":"2e4e9f0b-bf9f-4747-b751-ac5e31ba3107","resolution":{"observed_at":"2026-07-02T12:06:56.438710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:ef2565c303bf2794af1cee89bf8cff10b1d8c066a668a016577925815646d67f","observation_id":"b092c4ec-69cc-4936-a8eb-095eaa57e1d3","resolution":{"observed_at":"2026-07-02T12:06:56.438752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:6bcec6f63199846a20fddb6543ad80096071e6833e63a142325d38484a89731b","observation_id":"14dd87cb-18e1-40c3-ae63-0b100ed34c89","resolution":{"observed_at":"2026-07-02T12:06:56.456829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:6cdbe650269588e2e75bd39cb037436d40355288f65d47a8313a83b953d7e4e3","observation_id":"51bec505-12cd-4214-814a-f74b1d3f61ef","resolution":{"observed_at":"2026-07-02T12:06:56.446201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:06:56.401499Z","title":"arXiv preprint arXiv:2510.02172 , year=","venue":null,"work_id":"f7ef98ea-f2a8-4642-b3e0-d62a5235723f","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:bc60c4825dcaaa67a4ea6478288dd58d711ccc248c7dd474e2528e24fc469dd5","observation_id":"d725b3bd-2cd2-4efe-beba-0877aaf7be3e","resolution":{"observed_at":"2026-07-02T12:06:56.403210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model? InThe Thirty-ninth Annual Conference on Neural Information Processing Systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:00dd9b446b9e76629201343a0c6709d1520395858abeb337f35c6b8755cf39bd","observation_id":"5f93d10b-abed-4841-b427-b5c443caddea","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:08.493261Z","title":"On the interplay of pre-training, mid-training, and rl on reasoning language models, 2025 a","venue":null,"work_id":"0e148fc4-dd1f-4b6f-946d-385c5883da2b","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:4e62922804fa59551d1c646a243334efadb12293e4bf71ed24f2c0ada07dda33","observation_id":"826dfcea-4e34-4dc2-9e96-5a9b3c583ec9","resolution":{"observed_at":"2026-07-02T12:06:56.411254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:36.802333Z","title":"arXiv preprint arXiv:2509.25810 , year=","venue":null,"work_id":"28247d93-ae55-4004-9a8f-b6a9e538309f","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5e68de52fa487adaa72bd36124c969f5e63baceaabf2b9d63a8a5bdaf3e44a44","observation_id":"b436eb3d-c72a-4ac2-9093-dd0f0dd13dfb","resolution":{"observed_at":"2026-07-02T12:06:56.413232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c0d9dbf42e1f46c9c37acaaec6fbf335c76a0851e0ec3bfe13140e52667249d3","observation_id":"066f4021-50c9-41a4-b696-2c794db103c3","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:4d73203190613325cc6de4a44d63531773535b174caacbcc91507a22caab8c9a","observation_id":"4c242cd4-ec7c-43f0-901d-3edb7e28c52e","resolution":{"observed_at":"2026-07-02T12:06:56.403920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c6a4e791b2bfac4377cfccb4e0acd164f94e9ec7a9a5198a614d36067c5bedf9","observation_id":"024e228f-8c3a-40b3-93a7-ae7df8bbde22","resolution":{"observed_at":"2026-07-02T12:06:56.398549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15194","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.406410Z","title":"arXiv preprint arXiv:2509.15194 , year =","venue":null,"work_id":"9e4533d3-39f4-4116-a575-d72a6e615941","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b1fa9122d1cb50d285976a4ccc95ff5dab2da9b40fb01fb1ad7d1a766bf7b047","observation_id":"cc922107-1b70-4dd9-9ba4-9d7318dd7fe2","resolution":{"observed_at":"2026-07-02T12:06:56.400294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"[29] employed a semantic diversity score with an external semantic comparator, and Tuyls et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:56b63167f68dbd3b035eb75f9eeed87a586f309fbee43428efe56d4d6db6a2f1","observation_id":"183e932e-84d4-4260-9a22-8f1071cb96e1","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Setlur et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:40706de8dd118141ab9105afcbe53ba92271e1aab4de00b592f9010c3d47fbb7","observation_id":"f90062a8-11fd-4ccc-a88a-7c00d637077d","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"\" \" Com pu te s bi no mi al c o e f f i c i e n t C (n , k ) in log - space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:29d7b0dc59e5b698890a76a84bb24cf42254674edcdd52f62c79c1770de4ef4e","observation_id":"855ae7c3-8db9-4d06-9bfe-5b17296af384","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"BoN mean","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9f3dffd69886173ca8453e840e25b59d720304a0ea89645f4f04753684f7a27f","observation_id":"8fc7501e-7b95-47e5-986c-f736fdc0740b","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":30,"verified_exact":41,"verified_fuzzy":0},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 3 inbound Pith citation observations for arXiv:2606.06080."}