{"as_of":"2026-08-16T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f739fbc2dddefebc3b64e19c3bae241ff0794233d1a0c3da39bb74bd2468e016","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:43:00.193690Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17823/citation-record","integrity":"/paper/2607.17823/integrity","json":"/paper/2607.17823/citation-record.json","paper":"/paper/2607.17823"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.575378Z","title":"Max k-armed bandit: On the extremehunter algorithm and beyond","venue":null,"work_id":"30e9ffd3-c1f4-42b5-aa00-eabf88c6a9d7","year":2017},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.853729Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:47508a7654ced73bfdb621481659e237315a94f2d78ca95610b4fde024b0a9aa","observation_id":"625e53fa-f725-4c3a-a903-19d02bb5b830","resolution":{"observed_at":"2026-08-15T15:43:01.580651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.858827Z","title":"Model-based reinforcement learning with a generative model is minimax optimal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.858827Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2e0bf4289e6cc895736c10b71c4321f9d84830ed1b86962659512e30da1d59d1","observation_id":"07c00da6-1cb9-440b-9610-ffd8202ec4ab","resolution":{"observed_at":"2026-08-15T15:42:59.858827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.550254Z","title":"Rewarding behaviors","venue":null,"work_id":"b2b05ec0-c772-4f77-a140-a42f1622f1ad","year":1996},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.864050Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:0a188f97d9520847f3e199f368de62051f88798016befc36811a60e655d99969","observation_id":"47162232-2a07-4dee-a51e-1d65eeabdc70","resolution":{"observed_at":"2026-08-15T15:43:01.555000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.868809Z","title":"The best of n worlds: Aligning reinforcement learning with best-of-n sampling via max@ k optimisation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.868809Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d31fd13d799f73b34832c1a46988d523ea9c2f4ae2e2fa034975a4c066665754","observation_id":"f49fc2c4-5a51-461c-98c8-991e1fc12ad8","resolution":{"observed_at":"2026-08-15T15:42:59.868809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.532962Z","title":"Optimal rates for feasible payoff set estimation in games","venue":null,"work_id":"292fd0f5-aba3-42c4-9b04-6b6ab85df3ab","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.873641Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:287d1f33a262940359f6bf4fdbc938353c20629639696fbe08b9462d4fa2b6d2","observation_id":"8fd909a1-f7e5-4b00-84f3-c6bd2d5cb84b","resolution":{"observed_at":"2026-08-15T15:43:01.538800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.517332Z","title":"Regret bounds for risk-sensitive reinforcement learning","venue":null,"work_id":"e0bd4a00-7a7d-4834-b1f1-789734e8e9e1","year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.878445Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:af2b42e5f39cb4ca8e1a1ce00a39ebea2b591cb458454d663bda50e24bb6c2ad","observation_id":"dc095108-3c1e-42c3-9fbc-567fd533d0f8","resolution":{"observed_at":"2026-08-15T15:43:01.522317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10883","last_updated":"2022-03-21T11:09:34Z","snapshot_observed_at":"2026-08-16T06:39:41.827763Z","submitted_at":"2022-03-21T11:09:34Z","title":"Efficient Algorithms for Extreme Bandits","version":1},"cited_work":{"arxiv_id":"2203.10883","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10883","snapshot_observed_at":"2026-08-15T15:43:00.841509Z","title":"Efficient Algorithms for Extreme Bandits","venue":"cs.LG","work_id":"9b6d28b1-d91e-407b-bd92-842add7b78df","year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.883304Z"},"links":{"cited_paper":"/paper/2203.10883","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:ab4c16d08fb20d0848e40d4f8d5ca96f15975712b0cfb52d43092447f825463c","observation_id":"1b93c90e-f45a-484d-a499-3ff7ac0d225a","resolution":{"observed_at":"2026-08-15T15:43:00.847060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.501291Z","title":"A distributional perspective on reinforcement learning","venue":null,"work_id":"26da360b-9664-489a-9129-37db1d84c300","year":2017},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.888682Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:a8f7dfefa2390d0373386931b3fa30df43f100185435a62affb601ddeb337a36","observation_id":"1eb87b60-46ee-479d-82c1-a39110c44967","resolution":{"observed_at":"2026-08-15T15:43:01.506394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.893132Z","title":"Distributional reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.893132Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:10accddb04c1bbc4f308289562ff8720cc68e61b7f68995dc3cc0934de356142","observation_id":"922f4659-6ee2-4e0e-beb0-e2f7211de686","resolution":{"observed_at":"2026-08-15T15:42:59.893132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.475381Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"3f2ad1c3-d2a6-4857-8ebe-db71c0a61835","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.897682Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:7cd30a351e9564254231f737bad5169c522a6844ce37fc76562faa151b0efc80","observation_id":"562fbd03-df68-4cdf-8a0e-3e55637ccec0","resolution":{"observed_at":"2026-08-15T15:43:01.480410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.460138Z","title":"Concentration inequalities","venue":null,"work_id":"f340c0fd-21ef-4e82-a801-dbf83d3dc686","year":2003},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.902824Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:3045754333fb83ac32b8c540c1bb1954d4e50ca399a86f4e215577e1b72b4782","observation_id":"76f0cb61-4bc6-43ed-8015-1a75c354c82b","resolution":{"observed_at":"2026-08-15T15:43:01.464927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.443894Z","title":"Ltlf/ldlf non-markovian rewards","venue":null,"work_id":"74400724-f9ba-493d-a74e-5010be286f21","year":2018},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.907794Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:bf1ec209052ae5ca6b0971c8012fb8820e0f7c1ebdeee8ebb49f1943ab43e867","observation_id":"bb58fe7f-850f-4322-bbcd-dc3597d8f089","resolution":{"observed_at":"2026-08-15T15:43:01.449399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-15T15:42:59.913259Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.913259Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:718d6f6e279e848651f2dd2afac25c0d76a1a82d54aa1e64f99d59b02192ee5d","observation_id":"9fdfe351-46f4-495d-8ed8-4d466b2f21d0","resolution":{"observed_at":"2026-08-15T15:42:59.913259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.427654Z","title":"Extreme bandits","venue":null,"work_id":"ffb842d7-f623-4903-8526-542a3dd55cdc","year":2014},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.919440Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:76f20e680565df5dbc7229ad23971becffdb289f9118c6376d4091029babadd4","observation_id":"0a285c5d-5d23-4918-b36b-cabf9dd18427","resolution":{"observed_at":"2026-08-15T15:43:01.432510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13473","last_updated":"2026-06-11T15:27:06Z","snapshot_observed_at":"2026-07-06T23:52:14.348914Z","submitted_at":"2026-06-11T15:27:06Z","title":"MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2606.13473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13473","snapshot_observed_at":"2026-08-15T15:43:00.800242Z","title":"MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling","venue":"cs.LG","work_id":"2b8657f8-5e1d-4c11-9e45-22663dfdc813","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.924047Z"},"links":{"cited_paper":"/paper/2606.13473","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:3ea5577a90d62ed22a714875514337027ce264cbe8766e53b5e442c7a90b22eb","observation_id":"bfeca6e3-9d90-4053-8ae5-038570ccd3c0","resolution":{"observed_at":"2026-08-15T15:43:00.805866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T15:42:59.928939Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.928939Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d56ecc89fb2a9d357c266116a55a9942c490a1822f488af7ca551ab928b78cfc","observation_id":"40355f6a-ae50-479c-bbf6-c3036bc00e10","resolution":{"observed_at":"2026-08-15T15:42:59.928939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-15T15:42:59.933543Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.933543Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:1d0f27bdd45c1c44941114a891fe262670e7a8a529376b9fe6f2bd4851936ed0","observation_id":"2671270e-a7bf-4526-b5e5-6280f75f798a","resolution":{"observed_at":"2026-08-15T15:42:59.933543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.411142Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? Advances in Neural Information Processing Systems, 38: 0 57654--57689, 2026 b","venue":null,"work_id":"708886e7-76ac-4450-866a-b83ad1c299cc","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.938646Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:10e8ad728fc7b31b009cad52fcb6f3219207c4269b65eede8bb008fdcb4521e8","observation_id":"7b5455b1-d8ff-47a6-8215-6104926b509b","resolution":{"observed_at":"2026-08-15T15:43:01.416408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.391471Z","title":"Robust reinforcement learning with general utility","venue":null,"work_id":"9b3ae73e-b6c1-4b89-b31d-304cef8eefd9","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.945161Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:12e855e8fd96bdf18d8f0d1a043677567800f60fc7b117afe64994edd5d29808","observation_id":"8554e31f-2321-4536-b3c6-5be9d4c27a01","resolution":{"observed_at":"2026-08-15T15:43:01.396413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.375745Z","title":"Algorithms for cvar optimization in mdps","venue":null,"work_id":"6c6fb662-104d-4b57-a4e3-e5abc02ba719","year":2014},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.950006Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:3f8489dd0330096e6ac314f6da30b138c09b47ebff60bcc6866cecbb1bbe4701","observation_id":"a2533bf9-107f-4c86-9d69-6d7ce6a91b78","resolution":{"observed_at":"2026-08-15T15:43:01.381109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.359050Z","title":"Inference-aware fine-tuning for best-of-n sampling in large language models","venue":null,"work_id":"223d7e50-9627-4924-9280-42404ce95754","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.954810Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:702b4a5d3842cb743f5ec4e4073336b822855e6bba9404eae29c0381b5650eb1","observation_id":"aa071919-3714-43e4-b0ad-7743923b2799","resolution":{"observed_at":"2026-08-15T15:43:01.364580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06468","last_updated":"2026-06-04T17:54:44Z","snapshot_observed_at":"2026-08-13T13:43:20.358068Z","submitted_at":"2026-06-04T17:54:44Z","title":"Goedel-Architect: Streamlining Formal Theorem Proving with Blueprint Generation and Refinement","version":1},"cited_work":{"arxiv_id":"2606.06468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06468","snapshot_observed_at":"2026-08-15T15:43:00.746910Z","title":"Goedel-Architect: Streamlining Formal Theorem Proving with Blueprint Generation and Refinement","venue":"cs.AI","work_id":"b0566056-6624-456a-9c62-ac106ebdfaf9","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.959235Z"},"links":{"cited_paper":"/paper/2606.06468","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:59fa350ecbbceafb6c6490c2c9f492d260fb1b8222dde7ff59ad255529773440","observation_id":"629f9abf-1e80-4559-8c7a-5bf323b82482","resolution":{"observed_at":"2026-08-15T15:43:00.752025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T15:42:59.964054Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.964054Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:58ba859933371a04f9948b44a3fbc75852f22b0ce2bf744f52e64b50e6d228bd","observation_id":"8c2f4e4c-eadd-4214-ace6-6e0ff1a60848","resolution":{"observed_at":"2026-08-15T15:42:59.964054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-15T15:42:59.969022Z","title":"The entropy mechanism of reinforcement learning for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.969022Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:7a5b8c30188b91f0c3b2fb49f9442bbd5373c4b55c2ea53494ee5454539fbe68","observation_id":"e929eea7-8113-492b-9198-5cd1bc497a9d","resolution":{"observed_at":"2026-08-15T15:42:59.969022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.973762Z","title":"Distributional reinforcement learning with quantile regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.973762Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:c2425281b050888de6e9f336f448e6668de046730e2f2199bb019cdab37238c4","observation_id":"a57f932b-0639-4867-bf20-391465791a64","resolution":{"observed_at":"2026-08-15T15:42:59.973762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.332313Z","title":"Sample complexity of episodic fixed-horizon reinforcement learning","venue":null,"work_id":"e0dd62e6-39ee-49e8-bbdf-935abfe007ed","year":2015},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.978206Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:8d9e79a070b47daff4a405582d0d414dd7c974fb477a943d371aef0e8587beef","observation_id":"6c1b5b99-2c8c-4610-8596-d6b86f17a714","resolution":{"observed_at":"2026-08-15T15:43:01.337404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.316167Z","title":"Chain-of-verification reduces hallucination in large language models","venue":null,"work_id":"b99e2a4d-25a9-481a-a604-5e4f1859fdb2","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.982838Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:ccc573566021cc298c4bbc9a61679580c650387b404a38a1b1b538ff242d3416","observation_id":"71c59548-95e2-44ce-b301-6399e4e4a8ed","resolution":{"observed_at":"2026-08-15T15:43:01.321369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.987481Z","title":"Episodic reinforcement learning in finite mdps: Minimax lower bounds revisited","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.987481Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:4c8f97d4459bd5499f0a93ce163762752401e696593e2a1bb5ae37e3736fa0b4","observation_id":"0b9aa258-404a-4eb5-9628-71baec40fa45","resolution":{"observed_at":"2026-08-15T15:42:59.987481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.289747Z","title":"Risk-sensitive reinforcement learning: Near-optimal risk-sample tradeoff in regret","venue":null,"work_id":"f4b64316-a9a0-483e-9b5f-fb82dae00937","year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.991888Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:b5ddcb591a194c24727be9620c5a40b2cc1cf6598feda3a6ff974c2afa76e648","observation_id":"a6cdc281-69f9-4117-b890-a96d3ca60546","resolution":{"observed_at":"2026-08-15T15:43:01.294545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.274929Z","title":"Reinforcement learning with non-markovian rewards","venue":null,"work_id":"d8653114-16c8-4f50-ab8b-1f9d54532e64","year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.996244Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:91d32a62852a36505299a917f44e8bc6591edd8bc63b7b1d00b2be20df15b671","observation_id":"59853193-3c51-4bf3-8d76-b54f8961256d","resolution":{"observed_at":"2026-08-15T15:43:01.279736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.259168Z","title":"Explore first, exploit next: The true shape of regret in bandit problems","venue":null,"work_id":"232e048e-ed9d-43f4-9914-e5840589aa24","year":2019},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.000917Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2b18786e8b154b4ebd824669464ba066bb8360ebf0448c485a2413bc4aa5f1ad","observation_id":"6f889ea7-c8bb-4e4e-9bbe-35fafa7a31b9","resolution":{"observed_at":"2026-08-15T15:43:01.264333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.006056Z","title":"Minimax pac bounds on the sample complexity of reinforcement learning with a generative model","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.006056Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:ac2608eb38173109783eae6e88997c9cc855622abb6a73b8440cc09efb675700","observation_id":"7c2ef413-981c-447a-876a-4ad6be31dd22","resolution":{"observed_at":"2026-08-15T15:43:00.006056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:43:00.011209Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.011209Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:41ac636177b2069e98e89f614a91e61d0843db1c1d35639154d54f50cec46d02","observation_id":"668552ad-4f7a-4bb7-9d75-c4183ec9e73e","resolution":{"observed_at":"2026-08-15T15:43:00.011209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.233618Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"901eb33c-b4aa-431f-9ece-9ad171562a95","year":2019},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.016167Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:cd33e75b0891da7524d0f2a359154b06504141fb5160fdd7f0b6f7aabb97e643","observation_id":"5f55e9cc-c7e8-479d-9d3d-9372759007d4","resolution":{"observed_at":"2026-08-15T15:43:01.238724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.021277Z","title":"Reward machines: Exploiting reward function structure in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.021277Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:e67e31272078cad17de5333c4555ee779a8d7a9d35e2ac374f4dab5ed5e0f1ca","observation_id":"17730fc1-6c16-4a39-a6f1-762ade99ac0d","resolution":{"observed_at":"2026-08-15T15:43:00.021277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17912","last_updated":"2026-04-20T07:42:22Z","snapshot_observed_at":"2026-08-12T20:40:29.796485Z","submitted_at":"2026-04-20T07:42:22Z","title":"Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2604.17912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.17912","snapshot_observed_at":"2026-08-15T15:43:00.675834Z","title":"Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought","venue":"cs.LG","work_id":"187faf38-8479-49ec-8d53-33b908b6fb19","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.025992Z"},"links":{"cited_paper":"/paper/2604.17912","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:8292853114f541697401018e8eb3b4056dce194ad8bb60b076fdbcd958b77e44","observation_id":"06732d28-280b-4403-8bbe-0417d21f2aa0","resolution":{"observed_at":"2026-08-15T15:43:00.681559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T15:43:00.030970Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.030970Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:e74332194a2fdc60325753e89007721c9339c9014d7fdbb00422daf3b0806fe2","observation_id":"ab01f87b-de69-421e-83cf-e32cf398b70b","resolution":{"observed_at":"2026-08-15T15:43:00.030970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.035693Z","title":"Planning in markov decision processes with gap-dependent sample complexity","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.035693Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:41e49205beb1a3226b14ce8dd4287d5bb6e7d8be1aa9a34e786942a4db876b12","observation_id":"90a5d3d3-1c0b-4473-ac97-e58517198755","resolution":{"observed_at":"2026-08-15T15:43:00.035693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00991","last_updated":"2023-08-29T09:23:24Z","snapshot_observed_at":"2026-08-16T16:27:18.557869Z","submitted_at":"2022-10-03T14:57:46Z","title":"Policy Gradient for Reinforcement Learning with General Utilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00991","snapshot_observed_at":"2026-08-15T15:43:00.040269Z","title":"Policy gradient for reinforcement learning with general utilities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.040269Z"},"links":{"cited_paper":"/paper/2210.00991","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:85237a67adec77c6f907c842d77feda3edb2443136645b0463b7636f0809d47d","observation_id":"22699b3b-7ddc-46f0-811d-a0fbd40a406e","resolution":{"observed_at":"2026-08-15T15:43:00.040269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T15:43:00.045102Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.045102Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:13924addca5f63dbd4b31d5a58ac9fb5acf361fdbf4a6ae47cf6805f7cb7feb2","observation_id":"5d3e3b1d-0be1-4559-81ea-8cd12651222c","resolution":{"observed_at":"2026-08-15T15:43:00.045102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.195331Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model","venue":null,"work_id":"b4e3d6a3-1685-42a8-b1e5-5eca6b939831","year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.049986Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:322a059c36097f6885fff09e31bd3d5a7fd08e75dbeb1cf72a8a572f9f661da4","observation_id":"fcd66a85-f262-49b4-9429-9fe2ea430745","resolution":{"observed_at":"2026-08-15T15:43:01.200559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.054604Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.054604Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:dded40a904b4536019faadba119667161ee8cac976bf4b667afe818dc25e59c8","observation_id":"81685593-ebe5-4b03-9595-da5efc84ff48","resolution":{"observed_at":"2026-08-15T15:43:00.054604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.164826Z","title":"Let's verify step by step","venue":null,"work_id":"5d063022-823d-43d8-93a4-1e7f9fb7ed6f","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.059527Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d7d53dd992064eba0cd3021dc1c3afd56d872996b8a4615a6003b25765cdd1b6","observation_id":"91a9539b-b2f6-4ff7-a710-2cd01fbf50ff","resolution":{"observed_at":"2026-08-15T15:43:01.170258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.147456Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"3cdc5ecb-1b64-42b6-b82b-cb5d8dc33f37","year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.064216Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:e1ec683e976c5fe814d81756101721c48f9101978745d7439af17ca499158a55","observation_id":"aeb5fe5c-079c-4c8b-92b6-50f6800bb1dc","resolution":{"observed_at":"2026-08-15T15:43:01.152773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.131495Z","title":"Challenging common assumptions in convex reinforcement learning","venue":null,"work_id":"9b6efb64-7ec7-44cb-b683-a2882f777d6b","year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.068710Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d006a3f323f691ca785363c11054a1fc42cf6c0eac41c9bbc72de595d8283f42","observation_id":"2ebbdfa3-1951-496a-8bc0-acc6d8412474","resolution":{"observed_at":"2026-08-15T15:43:01.136470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.115260Z","title":"Convex reinforcement learning in finite trials","venue":null,"work_id":"c7ae02c1-d348-46ea-af60-62ad6a29bf49","year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.073411Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:fcf07530fc8f96c1dab82647c1bdb0918c464303f6d2cf2429b8bb93c377b467","observation_id":"8adae96a-6142-4b32-9a7b-1b874e16fdcb","resolution":{"observed_at":"2026-08-15T15:43:01.120510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.098346Z","title":"No regret bound for extreme bandits","venue":null,"work_id":"f1e9ee53-90d4-4294-8cb9-4e3aea78b477","year":2016},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.078160Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:10686773cb2267cd018a46be032019c32ff2249af02b80f70a81b85962b55cd5","observation_id":"be78362e-7f03-4f6c-b83f-723801e46e75","resolution":{"observed_at":"2026-08-15T15:43:01.103499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.082947Z","title":"Markov decision processes","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.082947Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:3b370cdc857025e646dbe89b579bdbc3e384927a20e13cda29edec51fe5f52f1","observation_id":"44e5bb33-067d-47de-b63c-0a47e274b126","resolution":{"observed_at":"2026-08-15T15:43:00.082947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.072186Z","title":"Near-minimax-optimal distributional reinforcement learning with a generative model","venue":null,"work_id":"55cea24e-6ad5-490e-99fe-686d5d489673","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.087694Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:17323dbcab1cd30c6b05d1d3b52a7c2a18bb0b48ac7899f749b53543bfa32cab","observation_id":"e77ccf59-7b37-4a5f-a864-b189e2736d86","resolution":{"observed_at":"2026-08-15T15:43:01.077284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.092288Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.092288Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:0105a5e302fb4e16506e8d5e7776592d43bdbce14684b4e9e8815d62f38e00a3","observation_id":"16e479be-4ba3-421e-9332-4a85203e27d8","resolution":{"observed_at":"2026-08-15T15:43:00.092288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01492","last_updated":"2019-06-05T20:49:17Z","snapshot_observed_at":"2026-08-15T18:24:12.153904Z","submitted_at":"2018-06-05T04:34:54Z","title":"Near-Optimal Time and Sample Complexities for Solving Discounted Markov Decision Process with a Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01492","snapshot_observed_at":"2026-08-15T15:43:00.097139Z","title":"Yang, and Yinyu Ye","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.097139Z"},"links":{"cited_paper":"/paper/1806.01492","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:54cad03d6c689f15f2f0dba9f0c6815cfbd428c55bc56631aeb6f5763410870f","observation_id":"cdf2dc89-efc2-4602-84db-0e7dfcdc4a67","resolution":{"observed_at":"2026-08-15T15:43:00.097139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.045301Z","title":"Scaling llm test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":"14f6f500-6cbd-43b4-b3ac-ddddb8991257","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.102134Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:c512390dda8ef70996ed4961cbf73ed5c7c2940ec8f5603fcdddb5f64ace2352","observation_id":"194ae738-564d-4436-b827-29d982c6e385","resolution":{"observed_at":"2026-08-15T15:43:01.050398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":"2606.06080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-08-15T15:43:00.589046Z","title":"On Advantage Estimates for Max@K Policy Gradients","venue":"cs.LG","work_id":"2f12fbb6-221e-4fcb-a45b-b1a299519772","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.107012Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:75a422b519c1a89b79bc6048a15087698fa16b1c1ca2f42d4aef2858bf27d2b9","observation_id":"ce10b7e7-ec70-4dd4-b0da-719367611f40","resolution":{"observed_at":"2026-08-15T15:43:00.594510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.029540Z","title":"Optimizing language models for inference time objectives using reinforcement learning","venue":null,"work_id":"db0ec9a7-322d-479f-b2af-449c1f120899","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.111838Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:3efffefd7c44f32f2c40c64fbb113231683625fa18999898c850a44aaf010def","observation_id":"29b53253-1846-4525-9ed1-32863b156d96","resolution":{"observed_at":"2026-08-15T15:43:01.034770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20854","snapshot_observed_at":"2026-08-15T15:43:00.116220Z","title":"Finite-time regret analysis of retry-aware bandits","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.116220Z"},"links":{"cited_paper":"/paper/2605.20854","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d0b3e992c5f3dcab1d5133f75199f5bd996d68a6e6590643bd65eccfb9b760c6","observation_id":"6c52c959-462b-42b7-8118-b8ff9fddab3f","resolution":{"observed_at":"2026-08-15T15:43:00.116220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"cited_work":{"arxiv_id":"2512.14617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14617","snapshot_observed_at":"2026-08-15T15:43:00.548193Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","venue":"cs.LG","work_id":"e8a68655-a7f1-4810-9ce6-2841326d80f2","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.121084Z"},"links":{"cited_paper":"/paper/2512.14617","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:e46caad26b93f1e7c99244a7ed6443d08153ee9a6107888a964d86a00e1129a4","observation_id":"a3287bdd-5ede-4ab7-bf89-b864090bc05b","resolution":{"observed_at":"2026-08-15T15:43:00.554958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22763","last_updated":"2026-06-08T12:23:48Z","snapshot_observed_at":"2026-08-14T22:53:19.958938Z","submitted_at":"2026-05-21T17:24:57Z","title":"Advancing Mathematics Research with AI-Driven Formal Proof Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22763","snapshot_observed_at":"2026-08-15T15:43:00.125774Z","title":"Advancing mathematics research with ai-driven formal proof search","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.125774Z"},"links":{"cited_paper":"/paper/2605.22763","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:19dc66ddef7737749dd84d4c8c082cbd1cc5b967a82dec3119e401f2685b3abc","observation_id":"f57f8433-a6f2-46bc-b670-d55b6d5b0f6f","resolution":{"observed_at":"2026-08-15T15:43:00.125774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.130531Z","title":"Recursive self-aggregation unlocks deep thinking in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.130531Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:7144aee57bf3c457a9fe54c0e4fb175dcbf8a1553463e0b3bbefb1782ea3a003","observation_id":"a5459578-ee59-4c28-bdca-e4a58431d1c1","resolution":{"observed_at":"2026-08-15T15:43:00.130531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.013837Z","title":"Pass@ k policy optimization: Solving harder reinforcement learning problems","venue":null,"work_id":"b4e64309-bd8e-4ced-96d2-a649187ccc75","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.135225Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:238270ccc208a34b2016dc5a4177494e35e7d6e3c671150d0cfded47f9270781","observation_id":"2d1235b0-03ef-4dcb-9484-78253068f15f","resolution":{"observed_at":"2026-08-15T15:43:01.018740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.996979Z","title":"Sample-efficient reinforcement learning for linearly-parameterized mdps with a generative model","venue":null,"work_id":"2915cb1f-e47e-40b0-867e-ac8c61e1d3ed","year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.139501Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:fca4a4da0c6c58ebd90be98dca3d59775957672d5c7116fd18b6835a24669043","observation_id":"1d36c955-e4b9-4b5a-8877-6cd7884a8c75","resolution":{"observed_at":"2026-08-15T15:43:01.002243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.143775Z","title":"Near-minimax-optimal risk-sensitive reinforcement learning with cvar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.143775Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:412de66152e346da729c22eb45172469987377f28f1ec89a2ad5c79ebf5d1514","observation_id":"08746916-6130-4183-a306-b7442a7ecd6f","resolution":{"observed_at":"2026-08-15T15:43:00.143775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T15:43:00.148168Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.148168Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:4139e859902dc412aa9ee9c55cb1b228ae5ce993508febd215515f7dee3d2e72","observation_id":"d44bf767-cedd-4e67-a821-4dd80d4ce061","resolution":{"observed_at":"2026-08-15T15:43:00.148168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13589","last_updated":"2024-12-21T04:11:08Z","snapshot_observed_at":"2026-08-16T14:41:04.718580Z","submitted_at":"2023-11-22T18:50:06Z","title":"Risk-sensitive Markov Decision Process and Learning under General Utility Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13589","snapshot_observed_at":"2026-08-15T15:43:00.152775Z","title":"Risk-sensitive markov decision process and learning under general utility functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.152775Z"},"links":{"cited_paper":"/paper/2311.13589","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:29a48d8bf90e9f2f874057a55b5706d03fb688f2ba2724357f3f7c4c3fe601ca","observation_id":"0e438ab1-7139-48ec-891d-ff09a2f5fbb6","resolution":{"observed_at":"2026-08-15T15:43:00.152775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-16T13:56:19.546679Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-15T15:43:00.157724Z","title":"Monte carlo tree search boosts reasoning via iterative preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.157724Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:259ef94411e3c8b17020a1617baddc8a804017f739e7835a4595ed458ab98560","observation_id":"aaaaf2ff-7240-4b6f-b5d1-0bd167f1baa2","resolution":{"observed_at":"2026-08-15T15:43:00.157724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-08-16T13:50:18.721796Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-15T15:43:00.162507Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.162507Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d2be04cb16f774fd9e293289bad569b4e0683411612e6c3faf820a390861ac5b","observation_id":"dedb8a22-c4de-48e0-a547-c5498c0a8718","resolution":{"observed_at":"2026-08-15T15:43:00.162507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.167272Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.167272Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:6ce0d26fed439e1bfafae7d6ed082c8ce8743775baf334df546d096fd48d85f4","observation_id":"9fe2c7f4-2c1a-4375-91a7-89e3fa68afdd","resolution":{"observed_at":"2026-08-15T15:43:00.167272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.958914Z","title":"Reward is enough for convex mdps","venue":null,"work_id":"9108e0f7-83df-423c-b14f-777cff033598","year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.171999Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:7507d8e1278d87d59a84ce28df8493990681d026a0b7092307c5d558522e7db3","observation_id":"b6238607-8f5f-46ca-8713-11438ee98bd0","resolution":{"observed_at":"2026-08-15T15:43:00.965177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.176430Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.176430Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:068abc0962499fe183a5f1dab9720a87f151af45ee12d61469f793b4b1799485","observation_id":"70cf53ee-3fe7-443e-bb61-d43a2682383d","resolution":{"observed_at":"2026-08-15T15:43:00.176430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.180627Z","title":"Variational policy gradient method for reinforcement learning with general utilities","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.180627Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:34749e0e3fa26b2bc0d2c0915cfdc527a0c6c9d091e7e9ae0e6814fa7a64a024","observation_id":"515c704c-2b96-4e6b-bef0-c23004832a7e","resolution":{"observed_at":"2026-08-15T15:43:00.180627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.184885Z","title":"Estimation and inference in distributional reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.184885Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:a0d98ed00083389630968f4fd06397a144c4410369f8096e91147d5c4bd68838","observation_id":"c7d0718c-3cb6-4fc9-aea5-be94c0641cd8","resolution":{"observed_at":"2026-08-15T15:43:00.184885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.189171Z","title":"Beyond markovian: Reflective exploration via bayes-adaptive rl for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.189171Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2f2890c9b402b42f45c03386a090cdb56c9c130934d0fc6c5e3feca66764bf9b","observation_id":"9851e4c7-a1ef-4e60-8eaa-f776dfdf292e","resolution":{"observed_at":"2026-08-15T15:43:00.189171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.920461Z","title":"Settling the sample complexity of online reinforcement learning","venue":null,"work_id":"0916349b-9f97-42de-acc9-87d77c087816","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.193690Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:5fc79e495e8123f3a179198d42bf8ed0a3d243da580d5edcd986c85419bb837a","observation_id":"0534ec8d-deb2-4ca9-84d1-a6cf374ac558","resolution":{"observed_at":"2026-08-15T15:43:00.927032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T05:07:56.523272Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":6,"verified_fuzzy":32},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2607.17823."}