{"as_of":"2026-08-09T13:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c10c9b8bc67a1661d20a48f7bcdd098b802ed3f1e4e70cb3a0ce440eb09e8978","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:17:30.974692Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:49:55.058885Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06096","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2606.06096 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-04T11:23:41.061756Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2606.06096","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:fac39ad8c074ada486548bfbb8050518105f257934b0252eec2f123d00b192ec","observation_id":"6896b378-7fed-44bd-b6f8-dcd0c1a30cb5","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06096","snapshot_observed_at":"2026-08-02T00:41:12.561057Z","title":"OrderGrad: Optimizing beyond the mean with order-statistic policy gradient estimation.arXiv preprint arXiv:2606.06096, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14962","last_updated":"2026-07-16T13:14:21Z","snapshot_observed_at":"2026-08-09T09:38:01.959634Z","submitted_at":"2026-07-16T13:14:21Z","title":"Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:12.561057Z"},"links":{"cited_paper":"/paper/2606.06096","citing_paper":"/paper/2607.14962"},"observation_digest":"sha256:13de677bfb89d73d1fbbf2eecfabf90dfbaf4564f7ced58124c7f2b83780d0c0","observation_id":"61c207e2-3e47-44ae-a1b7-dae906663094","resolution":{"observed_at":"2026-08-02T00:41:12.561057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06096","snapshot_observed_at":"2026-08-04T00:49:55.058885Z","title":"2606.06096 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00296","last_updated":"2026-07-31T21:11:48Z","snapshot_observed_at":"2026-08-08T23:55:30.721954Z","submitted_at":"2026-07-31T21:11:48Z","title":"Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T00:49:55.058885Z"},"links":{"cited_paper":"/paper/2606.06096","citing_paper":"/paper/2608.00296"},"observation_digest":"sha256:fd2bd311913d28195a826f43cfbb32f0646146177cf46bb50c770696ef7ce2bf","observation_id":"f65710a9-e0cd-46d2-9e9c-bdffc8fa8711","resolution":{"observed_at":"2026-08-04T00:49:55.058885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.06096/citation-record","integrity":"/paper/2606.06096/integrity","json":"/paper/2606.06096/citation-record.json","paper":"/paper/2606.06096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:bf23609fb15e44e97906c323a307bb6613dcb63b7990f7ce9daa92c4bac397f4","observation_id":"6bbe41e9-c457-4f14-920c-82a18c47909f","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Tasche, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b43364c1b3f9df4d41d29d3d95b98b751fc86b42ecaa568cae80e92afaf0e80f","observation_id":"67372aeb-1a9a-4e8c-b557-a2d193af377b","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Tasche, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:22c1703957cb72a3e4e05a2e620299465c3382144ece818db671c86d76b1c92e","observation_id":"8b6ad3c3-2312-4ad6-b21f-f67ff584f00d","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"S., Courville, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:ff5d55983b78f356b189a63b1efd86b3474e06731bf61b1e726ac57b901fe4f0","observation_id":"d734e41d-c2d3-417e-9e9a-4926572df2dc","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a5918f36e49898105f198122ddad8c5a6a224a0e5b0c487c69740777e0ee73a1","observation_id":"a8d38442-5171-4cd7-9f1f-616052ba1482","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"C., Balakrishnan, N., and Nagaraja, H","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a4095774e15150ff581bde25911bac129d474dc73e1b7376d4f6400a37c6e78b","observation_id":"0e9dc0e8-2467-4616-a2c4-77519f1d3772","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:2c4769ec49f1353834eea22a220fc5d4f0d5ff0cd1ccef4d76a5785f9e947d7d","observation_id":"ed458d4d-2b50-4855-a16a-068d74a833ea","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:56.995100Z","title":"The best of n worlds: Aligning reinforcement learning with best-of-n sampling via max@ k optimisation","venue":null,"work_id":"92afd1d0-76d7-404f-bb98-a521406f2c18","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7c9803eecf54b5f3bea12d1434c8ac2d54c05b44e033cc85a3962f66d1e47837","observation_id":"eed8db11-6ae5-4a2d-9b05-9405149729da","resolution":{"observed_at":"2026-07-02T12:16:56.997320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"W., Budden, D., Dabney, W., Horgan, D., Dhruva, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:2caa308991d81d513219542376987997d6d7f65c38681b6bfda1f8701fbb3821","observation_id":"8be19c04-74d7-47f6-b0fd-69d903612004","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d3b4d29154f6365cdb39ae7747a327f815ae3e80f31c9c02c71da9ee8978ae5f","observation_id":"c03f5b8a-27a6-4bcf-9d5a-7e7e1fb32cb2","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., Dabney, W., and Rowland, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7d0b20f6077eb6ca0fc7f9de6c8cd0d8a21a170a4c5f64ab4b8dee8cff71f8ee","observation_id":"e4c2d222-876e-467c-bbb1-80cf0a0cc093","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:cf55dd63d5d45ebf3a67b6d8e009947b3f764cf4d4896aa4a7c859892dcecd71","observation_id":"5f61ab70-1e4c-4b68-9837-e85bb3ca9da2","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:57.011864Z","title":"Post-training as reweighting: A stochastic view of reasoning trajectories in language models","venue":null,"work_id":"8c3af321-88c8-423e-84f7-acaa90a08cbb","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0460fe2bed9a1aa3e936cd6c33559dd037d71b68701cfae811c001e13f305aaa","observation_id":"6fed56f6-89cc-4ad9-bb07-21ea0d69d622","resolution":{"observed_at":"2026-07-02T12:16:57.013582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":"1810.12894","doi":"10.48550/arxiv.1810.12894","metadata_source":"pith","pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration by Random Network Distillation","venue":"cs.LG","work_id":"5a87fef6-96e2-4d5b-91ec-1a7c9a43cab9","year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:1ba8a44037e185897c040f54f2a898e6818e10495499c1194cdac6f883c97eba","observation_id":"a19832b1-e827-45fa-a9ac-bf417fe9fe36","resolution":{"observed_at":"2026-07-02T12:16:57.010748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:91b3c3721717b0c69ae87fdca09a3471b2934501d9e82b9db8e9b75adad987f4","observation_id":"6e07ee2f-1a3a-41bf-a214-2692d2c51cdb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:3a43bfde1daebf8be47203ce23cabf1ee6f7710ae22e1c74f7d8ddc27d4ea16a","observation_id":"bf266e16-1f0e-4beb-aa2b-53b43d7cb0ac","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:38:56.018423Z","title":"arXiv preprint arXiv:2510.15020 , year=","venue":null,"work_id":"6a468d06-b0b2-4d32-85fd-004b5cb11cc7","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5feac7b0f3a7c9379f7b7129bd0bc2dab7ab8ea53d351a6558fbb808d4531d56","observation_id":"1fd8f441-5de7-408b-9bc6-08fa8cb0c68e","resolution":{"observed_at":"2026-07-02T12:16:56.988341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5dd13e81a36d3505fd6ea767b17667c05b93d98e7dccb08888cab4c312cc7122","observation_id":"1488be54-a811-486c-99e9-7a5ac8d5a57b","resolution":{"observed_at":"2026-07-02T12:16:56.990950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e0461a6f5f3cc549e54e7aa9d7c9b67419ea0dd34981e14244f9f0aef5ea3923","observation_id":"742e7457-58dc-4252-90bd-f8328b9c11b5","resolution":{"observed_at":"2026-07-02T12:16:56.976361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":"2506.14758","doi":"10.48550/arxiv.2506.14758","metadata_source":"pith","pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Exploration: An Entropy Perspective","venue":"cs.CL","work_id":"5670d60c-ec64-40eb-93e1-1e51c35e9050","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:dfa90f65e9faeac7d90427098333ef80de597f3f901204b806052c07ec17e3be","observation_id":"1c3865e6-26ba-4ba3-9b5f-a6c6e499abc3","resolution":{"observed_at":"2026-07-02T12:16:57.019055Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b8f5dbca6bac1753b4df9fdee17e25dc4d6ef46bb3ffea8eb21a6b46c74bd8ea","observation_id":"36a0bd92-68f0-4357-84e1-0bd2ea533a84","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d27ebd455712accd31241b9558f7325e11f1350fd1f30c3c42e7f78245807978","observation_id":"a20b1c02-b180-454f-b135-13ecaaefcd35","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:551d2832aa4add5915da7b61f8ea33c7171fcfc67edd5efe7f37532e77e0dc1b","observation_id":"ca39b96c-61e0-444e-901a-9a0fad101445","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:9656217f0614e39759f986cc3a8435d23589950f9403a58f52eb55b6e50452f6","observation_id":"3508b074-851f-4c04-8f83-eb4b4f598bdc","resolution":{"observed_at":"2026-07-02T12:16:57.021716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"Y ., Jegelka, S., and Krause, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:3faa294ee639b9a9ba50f8209031701bb319e8b6ee405a73bfc668754e42b98b","observation_id":"f763a0cc-b51b-45be-a953-a99ac413ffac","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:1d61e3941c490f126cd660ef509a52f7b9db8b6a3026798ce4fe89506e57e977","observation_id":"409765b5-2fde-487a-8bda-19691b9bda7e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., and Munos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:79ab8e748d050829734a84eb17bc71118b057978f1674328d1b64af0f070473d","observation_id":"9aa3947d-975c-444e-98b1-f8ca28a6633c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5906374b1a242e4abae2caedac00feb288e64c93409cd006bdcc52428eefad6d","observation_id":"caf1c61f-194c-4cff-952d-45736a1b9343","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:293dc678c1e805012fe7cb82e439abe7fdef5ea6ab2dcae70304b25fa82e40e9","observation_id":"a394e4ba-cb6a-4371-afd0-3cad2a1afd05","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:215aa4afb74485844de24627c65a8ff92b229f19e5679855c448d7eb16321833","observation_id":"7542aff4-d641-4550-ab89-5bb7ad8db0ca","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.186056Z","title":"arXiv preprint arXiv:2505.17621 , year=","venue":null,"work_id":"035ff294-c5e5-4e88-ae7a-0df158e76e15","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:6ec54e10bdd79862963eac6b53d509e1574a5e8b79ce65ee6ff0efba1d58a423","observation_id":"71d004ed-24c6-44e5-9be7-c7ffa6695944","resolution":{"observed_at":"2026-07-02T12:16:57.024503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:ac70469875b91a23bc14ece1a4f60c1f22f21e9669fc3cc42d6e900c06c73702","observation_id":"fcce7173-ccef-4383-ade1-37a4c2d6d446","resolution":{"observed_at":"2026-07-02T12:16:57.027162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:fc495726ea55bdc813932093c03033faa30873745a21dc7310b211898dee6982","observation_id":"39634bea-8030-4353-8a14-f3064ea6f4eb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:ac9c6d7cb168d19d8b18812e482df8eacd3c5acff4d82785fb55fca60c5b0a9e","observation_id":"46d03bed-f440-4ded-ba3a-f1b6e0979fc9","resolution":{"observed_at":"2026-07-02T12:16:57.016459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"W., Fried, D., and Welleck, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0b13a86abbd4c0029f2ac6af4f6b4de5faf338c43ca742c0938f55bcf11a019d","observation_id":"13892c65-42a6-49f2-bc6b-0658da879580","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:ae3236ac96cf0b285649e68a561f99e4754d5e10decdd670b6fc39b43d8005ab","observation_id":"9fafb7de-e62c-4899-9c74-2a93f1656105","resolution":{"observed_at":"2026-07-02T12:16:57.029462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:658b5fd7442c3e7134d78eb9491e085075df587738cc8e641a13976a9f205461","observation_id":"18d09a0b-86b8-4d59-8d44-b996997d5cee","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b0fc6c0617eb4fd021baa48c3d5a7d45f320d561238712b0407a8ec9ddacccdc","observation_id":"e6ae0a11-c0c6-4e12-b5f9-c17f385aa5df","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a0144c9f5f507b628bf328ede044f35b6d89fadad6baecb1a32f3f638d7b579c","observation_id":"6d6d0b61-e21e-41ea-8e9b-7370b65312db","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:892c423029a0b51ace40675391abf7d3edad0d28fd57bc8d7ce7c6dbfcaeabf0","observation_id":"00b0c7e0-a956-4c99-892e-8928f9b3951e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23629","last_updated":"2026-05-07T02:29:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T04:10:37Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","version":3},"cited_work":{"arxiv_id":"2509.23629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23629","snapshot_observed_at":"2026-07-10T11:37:03.356545Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","venue":"cs.AI","work_id":"82ef2feb-9982-4d37-bac4-f9efd152cbce","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2509.23629","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:416696e5df22f2022b574a9f8c98d91a3b412e2d54d2c0b772cc90941cbe64f1","observation_id":"9c7dff10-a709-4c6f-9d85-ba27ac8b7fac","resolution":{"observed_at":"2026-07-02T12:16:56.947312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:fe2f2efa31da9f4ab3ed8c26c5206a350645f76224f7e5919d792ed93b92d5e3","observation_id":"4fb6ba7f-4d7f-4932-953d-d0ed1baa6e42","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:f303cdfdf4ae54d671565dc2c17c335020c4372d6154fd62f7763007c4a4f598","observation_id":"23e435fb-24b5-4bbe-914f-a260c9b40ad8","resolution":{"observed_at":"2026-07-02T12:16:56.941459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.299960Z","title":"arXiv preprint arXiv:2509.25133 , year=","venue":null,"work_id":"27ca51ae-e57f-4f13-9b0c-155064ec727b","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d2313183fb3f3c7f385d019770258a4d1a4f592f7720fcd92b914870ed61c947","observation_id":"98b231ad-f53c-4d69-ab6d-712a30b8dd52","resolution":{"observed_at":"2026-07-02T12:16:56.955387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:fe834a2e29b26dde497d6456079d5829d5587f706b4565050d1a70fcf0277131","observation_id":"d638f6b4-867f-40f6-858c-d3beea050cf0","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:8aa6d823fdf359dfb2aa7ff5289591084464e0190828f266d38d47aa26c9ab79","observation_id":"272c2537-9058-4dc8-a382-654e2f0ca9a8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4bbcd9c43df0ad0ec91d06e6524d7ff08f26b916fa9d98d6729292bf396ff4f8","observation_id":"3589b422-e57f-42c8-b3b2-334b8f4abbd8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b0d92d16b14a73e9e03a9a8a5a727781b47538d1937d2d7b503476d6be69ef2f","observation_id":"78e959cf-3164-40bd-afdc-a82d9627c7f8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:818159fd065497c9e061c7e63749c6645f94946ab06a6570f414939950794683","observation_id":"0e9b16a8-13c6-4e23-95ea-facf7c89e15c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4aa909307ccdff39d47a787c6ead0a8c348b71e7d7871294baa1aa80c99fb853","observation_id":"d15ad7bf-d25e-4e40-b78c-f27a85c75a2c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:6f770d19c801fc9e5a3d844ffcd08a19f773741ec5270a23842ad19cd75a14c0","observation_id":"1c0a6fd1-2f1d-4454-a872-e5b23f2bd29e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"J., Dohan, D., Dyer, E., Michalewski, H., Ramasesh, V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5972ddc415f4b37b5bd9fe53565ad22e074ebc276fca74e7fdf18a29402f185d","observation_id":"9766548b-9624-466e-94dc-8525bc3afc8f","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-05T11:30:06.956863Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:fbbb2e6b78aceac3cbfb8606e7fa8ce873d6731e17a0fa6450e6c090d1f339c9","observation_id":"3670faa7-ac27-4631-b212-00732dcaccf4","resolution":{"observed_at":"2026-07-02T12:16:56.970665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.372600Z","title":"Can llms guide their own exploration? gradient-guided reinforcement learning for llm reasoning","venue":null,"work_id":"2a20b1ce-d30e-4599-9057-c9f6932478b7","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:ffc8502c17ad971234184035e7ddf359bc9ae8e9a4ffdbc72bd2e97519fd4bbf","observation_id":"9019fbe1-78ef-4763-a57b-0c26f0bbe288","resolution":{"observed_at":"2026-07-02T12:16:57.038294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"S., and Lin, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:66524854c33d448083d2ae6d63a6265322245fc235c5e439cf2685c40514b205","observation_id":"ae639a4d-aa39-4baa-bfa9-0b79027870ae","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Mendelson, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:26cb21189251328ba13af4f93b639dab1415cdb26bac9d5423e76c2423782212","observation_id":"625f52d9-d87e-4203-b868-445bb8edead4","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., and Castro, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c90879355180d26192d204e6205afbb6bc589ed78aa5d4e865dbf527c611dbc3","observation_id":"d8983f42-171f-47aa-a584-d2012c607de9","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:91e1fd96423721835e201dfbbddde84560efc975e4bba013a64306ca8ebce036","observation_id":"00748d4d-6460-4689-b947-ed3a125f0071","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"A., Paudice, A., and Pontil, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:6fb721685d7fc4adf98323ddc32629a79a598237847921ae1f48f7bb32e9c3b6","observation_id":"42fd3e5e-01ee-4e2d-9447-2b59e0b22559","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d957d1be3d1ce4ac69db43fdb93252a8f557373b6f297c32cf0d119e70d33e20","observation_id":"d3c720cc-365d-4fdb-8f9d-61b1a536758a","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Rezende, D","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:6c374dcac9e5b5b808b62a5efb329f117c7016f45a5a413f86388b252be5ce16","observation_id":"0807f02e-bc03-4d3b-a724-32f4c6fc45ac","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:3d3488fa829e7971381ea277a3fc22007aae94e3c56540aa7abd1b6fa97eaa65","observation_id":"4025a78d-b25f-400e-99ea-087605a219bb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:6f84121a77dca92b54e26ffa9139f8b299c4869f70562b79173f9a8e9f327579","observation_id":"5ed2b147-4755-4f53-becb-57c6d150ae70","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5499fb1254f075cf8bad2df746805a5710f3fab62c96d4f35b73dce4910b498e","observation_id":"03f5c51e-1469-4234-874a-21e2a4a87cca","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:1b909b34b326e097c3b8c29e8907db5fa710960cc87a26f620739646f79f7344","observation_id":"ccf89d13-ded4-4b4f-8fee-bb8911bfd741","resolution":{"observed_at":"2026-07-02T12:16:56.985569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:eca0a84e36e92b6986df240e7da89c8733102c6ddc18d7658a84de27a767cde0","observation_id":"a679b167-5a0e-4a51-b5ee-d29384f3d52d","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:bd742af0c2619f92153f68936b74830d28702237a761ef47d4759834e8e5b887","observation_id":"9647f19b-b66b-4b1b-b610-53d5aac30c62","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Tamir, A","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:94f4d2e1564fdf1a45df747144efaf7b3e735cb32b8bb9d8674249e71cf3904e","observation_id":"6b263c29-38b7-479d-aa92-a2b9b6888a89","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:10bc8fbab47273ec68f409f3fd8348f43ffd7d8da4a96eebae97bc5f9655a5e4","observation_id":"c74060a8-830f-4b02-9856-42a131df3793","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":"1910.07113","doi":"10.48550/arxiv.1910.07113","metadata_source":"pith","pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving Rubik's Cube with a Robot Hand","venue":"cs.LG","work_id":"81bf9cee-6de8-49f6-b967-3cb853e5ba67","year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a80df17ac1afcc08f0af5b03bb2e3cc3f785408d338c97e9dda2fe61a651d3d6","observation_id":"f79f92d3-68de-466b-867b-49f33019373f","resolution":{"observed_at":"2026-07-02T12:16:56.958620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a9ee282bcbad6262b7a4ab0456135f30c41065a3d937d63f4dab1a3da8b04e6a","observation_id":"ce49015f-1f6d-4d6c-84f7-711e95b0b001","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b4af396ca5d9e3a51b531e9012d2bff26891585dfdf9e41464f5e007b26a8ae6","observation_id":"366f7fe5-0f55-4a60-bd85-cb0cdfcbc022","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"E., Peters, J., and Doya, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:14e2de67e330514e90a6f82b517f8149392f7666b41701dfca2ee1d4f723b7b7","observation_id":"31d081c9-15af-4a00-b9dc-1e2f6a7fe52c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Seno, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:bff102f9e1abd767676b89fd7fd7a489c576bbd74a52afbea3f2d70c7964aef7","observation_id":"d63b31ca-4516-4fdc-a7fb-d255de1e28bb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Sugiyama, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:1ddd2b5d414ecbac9523acf235c0e3f2f0111ad3b5ae95301ffad0d389293c32","observation_id":"48bce378-adb6-4362-a12b-305d0e744023","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0edaab147c3664d89616887ebb4b07f99ef4b558dc8ee473b3cc6c88632ab4e9","observation_id":"15b98f5c-1854-47f1-a3f0-8c48c9c161f8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:81520b30439c574e3a1c04f68706f65f44728b36df88df3e231e312ce8fb895a","observation_id":"5665ea70-ae1c-4788-af9a-821f9dc27232","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"J., Mohamed, S., and Wierstra, D","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e8c776b46cbe358f9a36f2719c22cedd5a6867368fbf2dcbcca689acddbf590d","observation_id":"f9f164ab-8727-48bb-950c-eca4c0fae80d","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:710a16ad3eb005aa2642b79a0328c57b5014f1dbd94dcdf003760d5a8c7fcd80","observation_id":"762b100a-b9d1-449c-897e-9cfcb64e726e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:59e99f77a4d61b9ce9fda68e1596ab3597a373c9da83afed93bac6e43f812938","observation_id":"e7a4de8a-e39d-44bd-918e-a5ce461b9080","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., Dabney, W., Munos, R., and Teh, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:f883529cf84ff20a67303e30ca5bd66153c616cc16f762f3933e48766054a5a8","observation_id":"9802d0fd-3880-406a-a74e-1e3427e73094","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., and Dabney, W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:f824a8c65633059bd4ededdd52e280f2c28e4a2ab7b7a791b050efeda87dd1ec","observation_id":"be2acb0c-fd65-4995-8ecb-78065e3b6f21","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-09T06:45:47.107738Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:63ca3305b8a54a286fd39efce1a407bbe539e7877814f07ebed4bd83254fc9d4","observation_id":"18fc5695-e22c-4d53-9796-fff3c94285ae","resolution":{"observed_at":"2026-07-02T12:16:56.964580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-07T21:53:41.208900Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":"2504.04022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-07-05T10:20:57.237283Z","title":"Rethinking reflection in pre- training.arXiv preprint arXiv:2504.04022","venue":null,"work_id":"dd1b4e9d-9546-4ae2-80c3-4c45b9cf7b90","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:bbbd8dc4489c0294c107924754546997f428d124bf64aacf4d777f474d9ce1ff","observation_id":"cecee2b2-8406-4f3c-8593-80399a10b817","resolution":{"observed_at":"2026-07-02T12:16:56.961703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Wexler, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:347c9978069c71a7a734cc012bbee18a8157807d732b27c33c2d8a0c0a8c3bb2","observation_id":"f96994a6-6f4e-4f8a-a684-bdd6ee636f34","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:46e231d715130dc5c3b593805e7aa9f6ba5953a028ed121212abc1ad8bdd850a","observation_id":"df998907-4508-4892-83b2-740c5a2795e1","resolution":{"observed_at":"2026-07-02T12:16:56.993763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:727913efbc31e6bef3960edb0b2ec49261cc02456095db5c6ed4742a2ba3eddd","observation_id":"45222633-c3e5-4ff7-be95-c38ad2ed293c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7d71dfd0268508fabb49eb388e2d651136b42d1fe9e1912f5e0dcce75c2340b8","observation_id":"dcd92603-873f-47ff-bb13-15e92155bbd8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Sanghavi, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a03ae8fcb1228ab955354a914f781059b75e00e436f757574b8e38bb6b1e1241","observation_id":"16bb2b31-70fd-4f6b-a9b3-4f2dfaea7c4f","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d2d4c62fe65d17017d00fbc608b90f85d4696dfce08e32a856cef5c14b6eb8f4","observation_id":"a8126bf8-e979-40d1-a9e8-ef3344887b16","resolution":{"observed_at":"2026-07-02T12:16:56.999981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"M., Foster, D., and Ghai, U","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:58c6dcf615fe5bcee26811fa9449295cef5c342ee510759112498fa6e2f47ca4","observation_id":"c5026d0c-818f-4ffd-b6fd-53933f5ceb13","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"M., Lowe, R., V oss, C., Radford, A., Amodei, D., and Christiano, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:f56ad3b9089b5e31730dd83b09dc754ad3bffe7e1e8a1fc1bbf10f4fab8c7ecc","observation_id":"7cbba2a4-979f-4a9d-a91f-c5bae3d4a6f5","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:9efe8bc863a8dc6dde0f66cae1094989e25d60ab76ad5ddadd038074c2c01ecf","observation_id":"4382454d-d04e-47b3-970c-44f0e977c931","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:302c7e7e765188515ed8cb24b3ffe3254350c2f97cdefde165f890604b6e5aca","observation_id":"6091ce7d-dbbd-47a3-9618-c718f9da7b99","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a2b40c4fd439a06e0b9625eaf5d4d498bd7445b982de46c72265e2ee04b3021a","observation_id":"13be03e1-bbe2-431c-92d7-0d7d73db1684","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c5d105e10a95060d736d9810d4c7f1f287dc2ac9731b9dc5a1a81d60c6e7eee8","observation_id":"c6196c4d-4b05-4577-9504-dfebd55d8b57","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Karkhanis, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:11ad240e6396c2f8449683c9d7d329bcb1f919f06d9497d3fe59e4e9bc4c7d74","observation_id":"52c6e4ae-7cdd-4b4b-87ca-dacc612433ee","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"A., Le, Q., Diao, E., Zhou, J., Ding, J., and Anwar, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:24a46070c4d3dd380ea479c6909c2f45d76022352fd9d6b995dc03f1e948fa26","observation_id":"14bc830f-7cf5-414e-be80-85bdfbde41bb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-06T22:44:10.264269Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:446f1775ee10456b22bb9cf565050fae6fee51f051b1d57c3e4ec01f24a3f9f7","observation_id":"32374512-3c5e-4da4-bf6d-26d1d08dc426","resolution":{"observed_at":"2026-07-02T12:16:56.982648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0f94ab035a5704519b989c9d441916ebf944d1a25329bbe59a4891178eb593fd","observation_id":"31dd2fcf-c01c-48a3-9055-5dfd79f5f970","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":75,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 3 inbound Pith citation observations for arXiv:2606.06096."}