{"as_of":"2026-08-09T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c4a9a23369d04a54f4856a0ddcedf3f8d9ea017f164ac9b3e174d001f12fb0e","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:40:27.181643Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19854/citation-record","integrity":"/paper/2607.19854/integrity","json":"/paper/2607.19854/citation-record.json","paper":"/paper/2607.19854"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:22.728512Z","title":"Optimistic posterior sampling for reinforcement learning: worst-case regret bounds","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:22.728512Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:d6bf7cd608abd8d8461ec4d1417448944be7ab12088e3c081ffd80029fc329a5","observation_id":"4801e300-7b59-41b0-8bfe-f7a0fcf0f73d","resolution":{"observed_at":"2026-08-01T11:40:22.728512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:22.814825Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:22.814825Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:8819723e8fd1d73b44a5e4e85855cb55adc4886846ffef9b1f7324dc4ffec2c8","observation_id":"6c269259-52a8-433e-bf90-68ac84d15294","resolution":{"observed_at":"2026-08-01T11:40:22.814825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:22.931295Z","title":"Regal: a regularization based algorithm for reinforcement learning in weakly communicating mdps","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:22.931295Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:f2968bf09ac04d485d60b28e20853ad5dcf3da5bb05b9745feca4868bf052816","observation_id":"fce1e969-1212-4c88-9cc1-30a58ceec6a6","resolution":{"observed_at":"2026-08-01T11:40:22.931295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.010077Z","title":"Brafman and Moshe Tennenholtz","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.010077Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:787c92c01bb88ebd279d28d32ec8834936c25ba2b03a9ac0cc0d4ea32d77a1fa","observation_id":"7ab63c10-7f08-477c-abc8-699b27b6aeab","resolution":{"observed_at":"2026-08-01T11:40:23.010077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05830","last_updated":"2024-04-01T00:56:31Z","snapshot_observed_at":"2026-08-04T08:52:08.292163Z","submitted_at":"2019-12-12T08:40:02Z","title":"Provably Efficient Exploration in Policy Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05830","snapshot_observed_at":"2026-08-01T11:40:23.151097Z","title":"Provably efficient exploration in policy optimization","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.151097Z"},"links":{"cited_paper":"/paper/1912.05830","citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:86c6b8f9d45df611828c81c0915bc8c313ca2039d5c3e0883a74f69d0150c8aa","observation_id":"9174a010-34e2-4312-9c41-61633472f8a2","resolution":{"observed_at":"2026-08-01T11:40:23.151097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.271360Z","title":"Implicit finite-horizon approximation and efficient optimal algorithms for stochastic shortest path.Advances in Neural Information Processing Systems, 34, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.271360Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:3732c789cb21707afd139296b2af04ac88241f17533a4e09dfb1d5f6dab7fcc4","observation_id":"e614e620-efcd-49f5-8143-c4dec2944f3a","resolution":{"observed_at":"2026-08-01T11:40:23.271360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.400362Z","title":"Sample complexity of episodic fixed-horizon reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.400362Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:f980152af579f635abcb2b4f0502f78ca171939da63a750ebfd5beb1bf93200a","observation_id":"15128eb3-93ae-4a2b-b3f8-ae7da0dcd47e","resolution":{"observed_at":"2026-08-01T11:40:23.400362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.552816Z","title":"Unifying PAC and regret: Uniform PAC bounds for episodic reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.552816Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:d37ddd3fb31fc7a2fe351b8b30db49cef6db5cf3a6799450dd21326b04a8ba98","observation_id":"00b6e90a-50bb-482a-ba23-3db55c9c7e5c","resolution":{"observed_at":"2026-08-01T11:40:23.552816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.740350Z","title":"Policy certificates: Towards accountable reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.740350Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:5e5a33f3f480c8af371834cae09a3c58a1459bcebf01057ef54531694bf39e25","observation_id":"31b74b9f-edf2-4c00-9f0f-fa38aafa09cd","resolution":{"observed_at":"2026-08-01T11:40:23.740350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09311","last_updated":"2019-09-27T02:09:54Z","snapshot_observed_at":"2026-07-06T07:29:14.938525Z","submitted_at":"2019-01-27T03:44:42Z","title":"Q-learning with UCB Exploration is Sample Efficient for Infinite-Horizon MDP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09311","snapshot_observed_at":"2026-08-01T11:40:23.836348Z","title":"Q-learning with ucb exploration is sample efficient for infinite-horizon mdp.arXiv preprint arXiv:1901.09311, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.836348Z"},"links":{"cited_paper":"/paper/1901.09311","citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:6300c62cf82d83c7947368be0c5aa1a7371df06a1691a30a5be32a887c1f0f1b","observation_id":"4c7bf4ac-ee8b-40aa-8ac7-de0c812c5dc2","resolution":{"observed_at":"2026-08-01T11:40:23.836348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.893443Z","title":"Near optimal exploration-exploitation in non- communicating markov decision processes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.893443Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:a88d3dbe39961ba0098dee8fcdabd24315ee9bcefb5419d18c48ef24f5e30aa4","observation_id":"5faac2ce-e8c0-48ab-846a-259c55210303","resolution":{"observed_at":"2026-08-01T11:40:23.893443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.944648Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.944648Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:c75f68f5a8c619a7cfcd3c394fbd4a5d7ed57f4b659503a4127bd2ac21865f77","observation_id":"e095135e-2139-42b5-83c1-2f0f2157a5a9","resolution":{"observed_at":"2026-08-01T11:40:23.944648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:23.994297Z","title":"Open problem: The dependence of sample complexity lower bounds on planning horizon","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:23.994297Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:1acc42cb6491a34ed3116ca8a30f2981c6860ec64e507b5261ab818aa77b9be1","observation_id":"7c6d83dd-0910-48af-a758-a4812b4c8f5b","resolution":{"observed_at":"2026-08-01T11:40:23.994297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.079508Z","title":"Is Q-learning provably efficient? InAdvances in Neural Information Processing Systems, pages 4863–4873, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.079508Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:d57a8f980e245395187f38237d08426ca33b48e0077cc60910a416dad2459c2c","observation_id":"7c7db996-bc4e-4ab8-8353-0bc018a3330a","resolution":{"observed_at":"2026-08-01T11:40:24.079508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.157975Z","title":"PhD thesis, University of London London, England, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.157975Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:da5c3ab93063645c8a9e3a86a95976088d5f66c8d2d398b8117ab39a2d0952ed","observation_id":"98353e53-0d49-439a-8d18-a6ecee66b4d0","resolution":{"observed_at":"2026-08-01T11:40:24.157975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.268544Z","title":"Near-optimal reinforcement learning in polynominal time","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.268544Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:82a95f5baaae695d589f5bab77799b3a98c3543675609da8e091263e7e999d5d","observation_id":"489bb316-9a4c-4425-a6ed-eabe06adb878","resolution":{"observed_at":"2026-08-01T11:40:24.268544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.384506Z","title":"Near-bayesian exploration in polynomial time","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.384506Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:d1a97af9237ac322fed5c8fb16d9a9423daec0acd5be7a76a3c78252542e33c9","observation_id":"fa7e42a6-9880-4103-857a-5b5834278656","resolution":{"observed_at":"2026-08-01T11:40:24.384506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.436716Z","title":"Pac bounds for discounted mdps","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.436716Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:bbce41ac7716609bee6038c561e7dd0b73ab49a9a5b9f6a7ba317e622876d921","observation_id":"d2da9399-ed90-4a4c-970b-8993b1be5470","resolution":{"observed_at":"2026-08-01T11:40:24.436716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.528200Z","title":"Breaking the sample complexity barrier to regret-optimal model-free reinforcement learning.Advances in Neural Information Processing Systems, 34, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.528200Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:c3f81ea020ddda03cd7c05fe8ad6433efb2dde861eaf3082745c856bf6eadc51","observation_id":"59bf1383-2265-46ad-8a9c-9bb2823128b5","resolution":{"observed_at":"2026-08-01T11:40:24.528200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.622410Z","title":"Horizon-free learning for Markov decision processes and games: Stochasti- cally bounded rewards and improved bounds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.622410Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:5c287b2e3d5d8bd3573e1591aa23855b08ae8c1f7f3ceba826bec6902f4c81f3","observation_id":"28ca7571-374a-4447-bd9f-0c3aaceb0e04","resolution":{"observed_at":"2026-08-01T11:40:24.622410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.723668Z","title":"Settling the horizon-dependence of sample complexity in reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.723668Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:6c4c6a40a2dc2c3b4c8c4a67e17d7788d541110658e9ba782929bf4a661a2933","observation_id":"ff56f70c-8e43-440a-ada9-b1c6b75b78d2","resolution":{"observed_at":"2026-08-01T11:40:24.723668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.839310Z","title":"Empirical Bernstein bounds and sample variance penalization","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.839310Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:7d59ca12a71e4ec33aeff8d05a50ecac3851b638968e650979d7008d9c8e6f95","observation_id":"bd057107-90c4-4b3a-a149-94e9ae10c6db","resolution":{"observed_at":"2026-08-01T11:40:24.839310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:24.923691Z","title":"Ucb momentum q-learning: Correcting the bias without forgetting","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:24.923691Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:11ba097d1bddcfe0f93a9ee69d95c65f710b99080b8f1ff9356900767dd7fb75","observation_id":"03d8f37b-4764-4631-8a16-006a14384333","resolution":{"observed_at":"2026-08-01T11:40:24.923691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01891","last_updated":"2020-07-03T18:10:30Z","snapshot_observed_at":"2026-08-07T21:36:56.941426Z","submitted_at":"2020-07-03T18:10:30Z","title":"A Unifying View of Optimism in Episodic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01891","snapshot_observed_at":"2026-08-01T11:40:25.011502Z","title":"A unifying view of optimism in episodic reinforcement learning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.011502Z"},"links":{"cited_paper":"/paper/2007.01891","citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:0b574f57cf0adf9b594dc8b8cfad4a2d00c2208d36a8022af4fd7131230f2c5b","observation_id":"6f199159-8fd5-4a68-8c4a-4f7a24c25b5c","resolution":{"observed_at":"2026-08-01T11:40:25.011502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:25.130168Z","title":"(more) efficient reinforcement learning via posterior sampling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.130168Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:6a0883280458342a8af8ce0ac550f3a41cc8046fb81875a63a5d2bd531536694","observation_id":"25829e35-b5ec-41be-90bf-7e226d8fc955","resolution":{"observed_at":"2026-08-01T11:40:25.130168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:25.306243Z","title":"Why is posterior sampling better than optimism for reinforcement learning? InProceedings of the 34th International Conference on Machine Learning-Volume 70","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.306243Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:1a94ebc47f4ce3551f5e4fcddd8813195c0acf8cb78fd724a88c3244c6d32876","observation_id":"245af5ec-f3da-421a-ba75-7cf266ec160d","resolution":{"observed_at":"2026-08-01T11:40:25.306243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11911","last_updated":"2021-12-03T21:16:42Z","snapshot_observed_at":"2026-07-06T09:31:11.484402Z","submitted_at":"2020-06-21T20:53:19Z","title":"Towards Tractable Optimism in Model-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11911","snapshot_observed_at":"2026-08-01T11:40:25.432600Z","title":"On optimism in model-based reinforcement learning.arXiv preprint arXiv:2006.11911, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.432600Z"},"links":{"cited_paper":"/paper/2006.11911","citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:dad341e12f6551f30f04c7bb6f4776a9d6d2da838bd48375b9bbe9aa95adbdba","observation_id":"b6a3e0ad-2587-48ca-ac34-ade72daa83ed","resolution":{"observed_at":"2026-08-01T11:40:25.432600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:25.606430Z","title":"Nearly horizon-free offline reinforcement learning.Advances in neural information processing systems, 34, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.606430Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:3aa3772e3141f470896d75cf29b8fceeafba4633826fc3ec7f7d97f43f3a1441","observation_id":"245c824c-5e34-434d-898a-a73e470f401f","resolution":{"observed_at":"2026-08-01T11:40:25.606430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:25.723620Z","title":"Worst-case regret bounds for exploration via randomized value functions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.723620Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:1b743de7e2a99ff6026a9561f64d00fb6cc1adec4da0128b7ad323bd8013c945","observation_id":"d2f5be01-be32-4e1e-b9a4-f79376a246d1","resolution":{"observed_at":"2026-08-01T11:40:25.723620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:25.800628Z","title":"Non-asymptotic gap-dependent regret bounds for tabular MDPs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.800628Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:b6a30ee791a800d7d4f5438f533cdb5993248cec1a0b9a90df21f9ca9c8d3843","observation_id":"4e8d873f-f2c7-4b34-90fe-a89e81992529","resolution":{"observed_at":"2026-08-01T11:40:25.800628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:25.889128Z","title":"PAC model-free reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.889128Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:88a6f2d9dbf9274b8590fe8af9041f4e87f8df6516a1c06548ff785353ff7b10","observation_id":"75b6acb7-2315-4367-8bdb-d6e9152453a7","resolution":{"observed_at":"2026-08-01T11:40:25.889128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:25.980493Z","title":"An analysis of model-based interval estimation for markov decision processes.Journal of Computer and System Sciences, 74(8):1309–1331, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:25.980493Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:d20f9e2cf9c5592815aacf16d79d79a1d7f7d95b8ec69d89fb5f963076add53b","observation_id":"adc7cf24-c48e-4411-acde-1175eb5923a7","resolution":{"observed_at":"2026-08-01T11:40:25.980493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.075780Z","title":"Model-based reinforcement learning with nearly tight exploration complexity bounds","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.075780Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:c75b8cb2ed000b68b7ef05ef7b4215f06a50e9186e82815c64123fd48958ae7e","observation_id":"59520a41-9a07-4041-af11-e2acddf13094","resolution":{"observed_at":"2026-08-01T11:40:26.075780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01626","last_updated":"2018-03-05T12:23:42Z","snapshot_observed_at":"2026-07-06T06:26:37.380259Z","submitted_at":"2018-03-05T12:23:42Z","title":"Variance-Aware Regret Bounds for Undiscounted Reinforcement Learning in MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01626","snapshot_observed_at":"2026-08-01T11:40:26.138252Z","title":"Variance-aware regret bounds for undis- counted reinforcement learning in mdps.arXiv preprint arXiv:1803.01626, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.138252Z"},"links":{"cited_paper":"/paper/1803.01626","citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:f5c0295702ce9fed3083012fb51ec2392fd53b844c1bb55a645bfe0dee0014e2","observation_id":"d18ebd5e-b905-4ede-a069-f6526fb93e1a","resolution":{"observed_at":"2026-08-01T11:40:26.138252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.236474Z","title":"Stochastic shortest path: Minimax, parameter-free and towards horizon-free regret.Advances in Neural Information Processing Systems, 34, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.236474Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:04758a49c48da6818f8cf3da0224c0c2b1454c97d2aadc929cbe981e6d4aeedd","observation_id":"8f2af213-6957-4163-b8e0-5c1528a40e63","resolution":{"observed_at":"2026-08-01T11:40:26.236474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.311969Z","title":"Is long horizon reinforcement learning more difficult than short horizon reinforcement learning? InAdvances in Neural Information Processing Systems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.311969Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:63d59a6b39b8455be5d31af9a275be18c32e9958b87c703003a8ff23f33d3e11","observation_id":"d572841b-2c0e-452e-bc99-aa6a402735a8","resolution":{"observed_at":"2026-08-01T11:40:26.311969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09703","last_updated":"2022-10-13T01:13:42Z","snapshot_observed_at":"2026-08-04T11:20:08.270262Z","submitted_at":"2021-02-19T01:42:50Z","title":"Near-Optimal Randomized Exploration for Tabular Markov Decision Processes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09703","snapshot_observed_at":"2026-08-01T11:40:26.383570Z","title":"Randomized exploration is near-optimal for tabular mdp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.383570Z"},"links":{"cited_paper":"/paper/2102.09703","citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:5f55caf0a7bb9ca0b67d61fb3ce5076a2611b9599693dab328d3a70519e16c7a","observation_id":"041767f7-ac81-47bd-a7a1-123a5d521c32","resolution":{"observed_at":"2026-08-01T11:40:26.383570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09118","last_updated":"2021-02-23T11:44:44Z","snapshot_observed_at":"2026-07-06T09:29:36.481774Z","submitted_at":"2020-06-16T13:01:33Z","title":"$Q$-learning with Logarithmic Regret","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09118","snapshot_observed_at":"2026-08-01T11:40:26.463961Z","title":"Q-learning with logarithmic regret.arXiv preprint arXiv:2006.09118, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.463961Z"},"links":{"cited_paper":"/paper/2006.09118","citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:0a0e29241ba2da205d8551e2fc0228fed3f00a6d8e82810f34674444b226f96d","observation_id":"de55941f-e943-4f1b-875e-15a01520adff","resolution":{"observed_at":"2026-08-01T11:40:26.463961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.560944Z","title":"Is reinforcement learning more difficult than bandits? a near-optimal algorithm escaping the curse of horizon","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.560944Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:81022706633b0d0ac8fd530762b88c209cac742eb2b8e461924a5c0a6b78bf6b","observation_id":"e0baaf33-cc64-4e9b-afe5-77e15b5ab775","resolution":{"observed_at":"2026-08-01T11:40:26.560944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.624890Z","title":"Horizon-free reinforcement learning in polynomial time: the power of stationary policies","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.624890Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:6b6c67f9b758e50a1cb80a5d0cf7abbf318be55d19f783dc5a1d74e98f923ecb","observation_id":"c354c13d-6c92-473b-8046-e54aba83750e","resolution":{"observed_at":"2026-08-01T11:40:26.624890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.701935Z","title":"Variance-aware confidence set: Variance- dependent bound for linear bandits and horizon-free bound for linear mixture mdp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.701935Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:6d306ce04f24ba4920ddc703124354c12b700c34f0cadd85be3e36db140ad143","observation_id":"06a19116-357c-426b-8a81-1be9e439aa0f","resolution":{"observed_at":"2026-08-01T11:40:26.701935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.781590Z","title":"Almost optimal model-free reinforcement learning via reference-advantage decomposition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.781590Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:e4d768658cb18e9ead91084018fc999908b689ed0493e245657c8ca5ba59d334","observation_id":"e022117d-be36-46b2-9812-c2b709538011","resolution":{"observed_at":"2026-08-01T11:40:26.781590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.849097Z","title":"The horizon-truncation lemma implies that the optimal H-step value is withinOpυqof the optimalH 1-step value","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.849097Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:b2beb69e0b36fb92f55263d03832d1a600002c763f0f566b34aa7b16d936e6a9","observation_id":"4bf24377-46c4-429f-a828-bbbcb4807ab2","resolution":{"observed_at":"2026-08-01T11:40:26.849097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.932895Z","title":"The proof is a backward induction on h","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.932895Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:5969d30d239aa5f3149b6d2a6aeed0da99d31d5f0ed1a49b220bd1285bb9f00f","observation_id":"4f34ac99-42d8-4c7e-927e-d1aa34d12138","resolution":{"observed_at":"2026-08-01T11:40:26.932895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:26.996404Z","title":"The process is stopped when the trajectory reaches the unlearned set Ok or when the frozen count of a learned pair doubles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:26.996404Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:9a38a34b4491adfbecda2149725ffcd66eb9abca0a2b33e0dbb5bc90ae1f87cb","observation_id":"65ed91f3-fcdf-41d2-8e0d-e25b251464ab","resolution":{"observed_at":"2026-08-01T11:40:26.996404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:27.111719Z","title":"This requires a variance closure argument for the optimistic values and the optimistic gaps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:27.111719Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:8a0115088ed8ad6eb6915e0cc92539da46718846af053b4f188a8e5030891fd1","observation_id":"7d4e9a66-26ff-4174-b235-29c98665c644","resolution":{"observed_at":"2026-08-01T11:40:27.111719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:40:27.181643Z","title":"V ˚ H1`1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:27.181643Z"},"links":{"citing_paper":"/paper/2607.19854"},"observation_digest":"sha256:76405de9746784da5c88473f8df4094ba24fce94ff5283523a54ba1fd822faba","observation_id":"56d6f6be-6c0f-41bb-ac7e-04de21c57a2d","resolution":{"observed_at":"2026-08-01T11:40:27.181643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19854","last_updated":"2026-07-22T07:42:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T11:40:18.790734Z","submitted_at":"2026-07-22T07:42:19Z","title":"Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2607.19854."}