{"as_of":"2026-08-22T14:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c5d61763e36ba76bf4bab6c1d4252b6766ae85ff872f86f349290547825741e","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T18:19:02.314185Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.20107/citation-record","integrity":"/paper/2606.20107/integrity","json":"/paper/2606.20107/citation-record.json","paper":"/paper/2606.20107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the Fifteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:9279990ded5e490689e9c0df848a7f5ae4405a51db49163e736ef2542e489205","observation_id":"12734446-02e3-496e-9c9c-8c6927650e7b","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Bootstrapping Upper Confidence Bound , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:a0b845b96e6540cc2f7882837a08b11b237ed6bc7341880ef0a80ece63c28ede","observation_id":"90c09c01-f499-4e9b-8afb-04f735e5d248","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-2947","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Regret of Linear Ensemble Sampling , volume =","venue":null,"work_id":"390d5a2e-b66b-4ce3-ab61-1da964567f2b","year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:8be8a0e8a91fb915f1e106499f1fef903bf0310a471db365efc3d24cdd5b69f0","observation_id":"83d3dee0-071f-4e6e-9397-c2e57a006008","resolution":{"observed_at":"2026-06-26T18:19:40.747180Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Optimistic Posterior Sampling for Reinforcement Learning with Few Samples and Tight Guarantees , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:052eb1b02dbf8ae35e39dc10bbb6f01fdbd2202d9e926d2ca9450c6e46666bdd","observation_id":"3d5789ba-d12b-48f3-a86a-3d6603c7cea9","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:10b2a0ab3177986655b4cb92d4cb63ca8c77d63c9a24aabc7c569ed98e43e420","observation_id":"437a417e-f93a-45cd-aab6-81112fc29bab","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"2025 , editor =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:e7a64cb624921e9af8ae2dd4aa204818ae242b34f8cacb4f3baa267f46a2b038","observation_id":"afd9f37b-6cc7-4e0b-b09a-91c1d0d8c7ac","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:ad0853676817551efdfdf0ce33232f850c417428f5966ffb14df31cc35d5ae75","observation_id":"5f76228e-88cd-4663-bcda-3e7ebeb8f117","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:98df4c7963ff4f33cde0b9694ba9d8a2392acf223789eb5c505bf2fb04d63d5f","observation_id":"29389561-92da-4984-bdee-4875e2d2010a","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:a44678ac2352f03e70d8031409fefa0956bf76265d57d546ec20c234e3611f28","observation_id":"bd4335a7-45cc-4795-9d5b-e5232cdaeeb1","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:aa476dda8e7b28aa77b5388a2e6e9dc720af7350daeb66c74e64e257c6f8bb20","observation_id":"e4106064-bdb9-42ff-8e1e-ef0f12a4265b","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:ba5ce65dc12da049b416588fb782ebf839470621db447b0e24389d63ff9d4ea8","observation_id":"b0430f90-d916-4754-8338-28d5643adf49","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the 32nd International Conference on Algorithmic Learning Theory , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:60f4bebfbdd82595fca29d26753e6e70eac74917915caaee207d16191dd0b7d7","observation_id":"b8342236-8844-4ce0-a9dc-5c94ce322339","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the 40th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:24f43afcc6af50ee4752da89a3e9ce9df7f9c9eeddf4d4ae449cc69acaf9f75a","observation_id":"f437fc4a-c2c8-4fef-a712-c2bb33b82326","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:476a59a642930c46e9d345747b8aad815a9d20a98f3951d4d25c5bb5bf26edc1","observation_id":"89a57b23-fec2-4b68-b4e6-8dd2409681f1","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:e07565b55471c479d75332d42ad8d45a9016cdfc0685c421e3c73e171ed3ff14","observation_id":"aaf9fe1d-cf94-4299-a4bf-7055681f236e","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:4ac42b94ac5a2a4d29204541842283fbf52dcb7d53fd49eff92aeefd8b5606e5","observation_id":"da64238e-7157-427d-be5a-8737151a3336","resolution":{"observed_at":"2026-07-04T03:09:30.512889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:37dfaf42fbdadd49abb7217f89116a31d940eb0fd6fec87213230b0d8a4792f9","observation_id":"eab26384-a028-4c6d-a87d-40ab20c97758","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:a4b64aec871ca7da1b7e39c4d676bd27c2f14574df2ac587cb9953cc2ec590bb","observation_id":"20ff5d3f-bd4e-4b0f-a116-a5442656ccdb","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:e41532a018a34a8aeb3019a4c74c3399553648e5054a83e7f74a9df70372d95b","observation_id":"21268bf4-4fd7-4aa3-8320-c0bbfa0b7825","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:58ff2d34184f28f4d3978a0023d34e1110bb713a29b6fe72e1557f1044a6e5c1","observation_id":"ca7fb98d-b44b-4fe6-8230-5d31e1be0947","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:4a97d42416ee8823593b2ed324de81f219c792f19d7e1f366a1b4a06490fa317","observation_id":"d4bd8b34-1b38-4130-9cee-fc4f2d48efb7","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Ross , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:d2298b5cfad7bb38d17e47521d2eb3b3c36f2cf1267b50b8f8d1017539a1fd44","observation_id":"1380c393-1b4e-403e-b969-b0e67c4b1e64","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:fd4e60a432568e57d78bc2aa51d61dbda3f73b69850dd98a7f269155458dc593","observation_id":"7a685bf5-2c9e-43ed-83b1-a794f8a82de6","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:8cc9b68005cd049d64b14c197d19826bb25e0a87f8ce1d5feb88bb2d7cf9c4e6","observation_id":"5bd3de41-eb76-4281-afd9-205cdf429873","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:3f7c7334af7ccf04d454fb1f916b93ec309b985d9b5123d63a737ecd5275db78","observation_id":"c835a4c0-1a1e-48e0-8703-620700e6d563","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the 36th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:a5e55bde7972b9feaf39db59877412b3952972cba3e54beced75faf40f46885f","observation_id":"0816ab43-8777-4fda-a912-8a47270f5260","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Reinforcement Learning with Lookahead Information , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:a88b50ff86e92a47c6342616f030cab3d5b60b8a461bfe6a5c012477f19a7013","observation_id":"3ec1eaa9-3aed-4416-98ab-b68d0071ab44","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the 31st International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:c87233cc455f42096610b35eef7333a3c5a1431d482ada5114d26382c242db0f","observation_id":"03af24e6-3c9c-40ea-8da0-3e78ebf94520","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:0754a2d78478255be162476b074a93d99074c2d2892bb3c36f707c158b75be7c","observation_id":"7bfe7b88-4c81-4464-940e-96c5a16c32d8","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Freedman , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:a0c9043cc34537c00bfa27d3c449c4c5b9dd2d783f16167ab24e0d9591869722","observation_id":"a92e5af0-eb7a-4c01-9ce3-06b915c55026","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the thirty-sixth annual ACM symposium on Theory of computing , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:23a52f4ec9f9ef19f7cbef4a2f2c2ded87c806988d853517e9010e059b7a076d","observation_id":"0a6bb9ab-e3f3-42d8-bd69-ca8a5af13e7d","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01502","last_updated":"2017-11-07T20:45:59Z","snapshot_observed_at":"2026-08-14T20:55:58.284097Z","submitted_at":"2017-06-05T19:01:26Z","title":"UCB Exploration via Q-Ensembles","version":3},"cited_work":{"arxiv_id":"1706.01502","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.01502","snapshot_observed_at":"2026-07-04T03:09:30.514483Z","title":"UCB Exploration via Q-Ensembles","venue":"cs.LG","work_id":"5e090ae9-8be7-4f94-a260-9093d69dd328","year":2017},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/1706.01502","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:5064bea6212ccc8bcbcc7ca4790493b9f52c61d485e93e6a2ea4782905054272","observation_id":"7ae7c894-47f4-4c60-b83c-99c6921cf039","resolution":{"observed_at":"2026-07-04T03:09:30.515885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:1935fa70754f836829cf7616e0210ecb7e7ee21d45d1177c828c3fbcf66b1968","observation_id":"5f6787c5-a0c1-42d5-8ba7-d2a8eec5d5f6","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:5631061dcee470ba131acb003b17ec35cb8f972737ace22810fb489d80bbe88c","observation_id":"d9d22883-bfc5-4b3a-8a2f-b078a417c32a","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:4eba909ea91116a8d59c0c4f1f2f2f7ad8e7dd4ae79e0d72402afe36aaaf80e2","observation_id":"25390624-fe90-4077-ad9f-6c742bbb154a","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:87a55cb7781069c5c407c4823f111d228743f9803b8e0f516d4bf3c0b1b6d438","observation_id":"1fc2edd4-9207-481e-861c-f1b1c5e766e1","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04157","last_updated":"2022-10-09T03:50:05Z","snapshot_observed_at":"2026-08-20T09:26:15.487202Z","submitted_at":"2022-10-09T03:50:05Z","title":"The Role of Coverage in Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2210.04157","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.04157","snapshot_observed_at":"2026-07-07T14:33:54.431062Z","title":"A general framework for sequential decision- making under adaptivity constraints","venue":"cs.LG","work_id":"367e47e1-b4fc-4d4c-8249-3c3f2054b030","year":2022},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/2210.04157","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:7d7913a747f8dac981afb31200fb33a2fbee2b503de3ed7b64aa1dd5447ef314","observation_id":"23ae7914-0cfa-4e89-8e78-cca036e5460c","resolution":{"observed_at":"2026-07-04T03:09:30.520219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11202","last_updated":"2022-04-11T19:34:30Z","snapshot_observed_at":"2026-08-16T17:47:35.549435Z","submitted_at":"2021-10-21T15:25:15Z","title":"Anti-Concentrated Confidence Bonuses for Scalable Exploration","version":2},"cited_work":{"arxiv_id":"2110.11202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.11202","snapshot_observed_at":"2026-07-04T03:09:30.520310Z","title":"arXiv preprint arXiv:2110.11202 , year=","venue":null,"work_id":"28269fca-3958-43ac-bb3d-00ddf317348e","year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/2110.11202","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:10b535e1e8c6f8fa351c5a7a4f1194082245dd409a5417dc2fd2584af22b535c","observation_id":"b1de570e-f523-4a7e-83ef-c1052e64973d","resolution":{"observed_at":"2026-07-04T03:09:30.522465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06132","last_updated":"2023-11-04T01:56:36Z","snapshot_observed_at":"2026-08-16T16:09:12.779799Z","submitted_at":"2022-12-12T18:58:59Z","title":"Nearly Minimax Optimal Reinforcement Learning for Linear Markov Decision Processes","version":3},"cited_work":{"arxiv_id":"2212.06132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.06132","snapshot_observed_at":"2026-07-04T03:09:30.521560Z","title":"arXiv preprint arXiv:2212.06132 , year=","venue":null,"work_id":"2aa27723-9757-41ba-be49-d0805ef5fd22","year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/2212.06132","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:3894f11025d3aec029559eef3c631690585c52a1a8e2b51f642cc984f601d443","observation_id":"778a3d1a-1d8e-44c0-bade-324633c8f74e","resolution":{"observed_at":"2026-07-04T03:09:30.523310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the 25th Annual Conference on Learning Theory , pages =","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:49672ee582fcfbdd959acc9451503ab3164e3882c20e15c0bcf834e6c793a4b1","observation_id":"6fc1296e-a623-4173-bb8f-f3e636d3f293","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Bulletin of the American Mathematical Society , volume=","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:8dfaf720585fe30deec71e9fbb9441894dda9a7134625924de2b376960d7f2e5","observation_id":"7eba8446-0c69-46a1-86c8-48d71543e639","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in applied mathematics , volume=","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:576884e65ed82b076cc11179601ea6bd92e1e43073d991fef5cdccae03a5ab9b","observation_id":"9e3632b8-0655-40ca-8e20-0e2e8baba817","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:10c06b78b2b855e0891e0477caa40f979a78848312b21198604f03591bebe19c","observation_id":"66331e35-7d7f-404d-ab99-8bda39808835","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Proceedings of the 24th Annual Conference on Learning Theory , pages =","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:bee104ebea399766bb57b940676bf241b5779da042f5a4f383e0b88bb0130e18","observation_id":"9649b904-b5a8-466f-a223-de42e762f34c","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Integer Programming and Combinatorial Optimization: 7th International IPCO Conference Graz, Austria, June 9--11, 1999 Proceedings , pages=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:69b177addcd75400891fc3868a01fa6ccd1fd33d9a3fc05dcbc985af8425da0f","observation_id":"cfa263b9-c7ee-4b11-882a-25332a16cc0c","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"ACM Transactions on Algorithms (TALG) , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:3457b9f315a9f909d5db08a32c7299b3178a3c98d75c210d286d53bf85407f68","observation_id":"857283d5-ff09-4a1d-9f7c-42ba39fb3d5a","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08376","last_updated":"2025-01-15T15:41:09Z","snapshot_observed_at":"2026-08-21T10:17:08.713456Z","submitted_at":"2023-11-14T18:41:28Z","title":"Ensemble sampling for linear bandits: small ensembles suffice","version":4},"cited_work":{"arxiv_id":"2311.08376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08376","snapshot_observed_at":"2026-07-04T03:09:30.498865Z","title":"arXiv preprint arXiv:2311.08376 , year=","venue":null,"work_id":"d62d89b1-b454-45aa-970b-12d21e7d361c","year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/2311.08376","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:4aa89ec9ec15b387f025cfbe0b87edbd4ab12b84910b2739adad78c3c7000e28","observation_id":"5374735b-6114-4681-9df8-05501013a69e","resolution":{"observed_at":"2026-07-04T03:09:30.500673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05435","last_updated":"2023-08-10T08:49:15Z","snapshot_observed_at":"2026-08-16T15:09:26.603802Z","submitted_at":"2023-08-10T08:49:15Z","title":"Another look at binomial and related distributions exceeding values close to their centre","version":1},"cited_work":{"arxiv_id":"2308.05435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05435","snapshot_observed_at":"2026-07-04T03:09:30.507342Z","title":"arXiv preprint arXiv:2308.05435 , year=","venue":null,"work_id":"d484c2ae-c2a0-4563-9a03-f814c0f58da4","year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/2308.05435","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:736cd749e7a130ee85ff7322bb6816754f3c42a5abc027e44efca666b32f3e59","observation_id":"57b4573f-5d30-42b6-8bb9-33be67fc7ba5","resolution":{"observed_at":"2026-07-04T03:09:30.509382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"The Annals of Mathematical Statistics , pages=","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:bfb912bb8abce4b73108252500d25d968db8d84bf7decad2df2a82d589ce7ab0","observation_id":"ddaf2d8e-2280-44ae-96e9-0fda97d8f066","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Theoretical Computer Science , volume=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:8e057edba50a43489436c2e702d2157c68ec1235d3d99cc5e8f9b0ff36530ab6","observation_id":"b9af1033-f8ed-406e-9e53-e5b1969e23ce","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Residual Bootstrap Exploration for Bandit Algorithms , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:302d2235dd00e9b889edaf49d47a15f5ba78482f69a10dd92cd64759b1117622","observation_id":"5ae20338-0ccb-4482-a672-7b390bc7b183","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Garbage In, Reward Out: Bootstrapping Exploration in Multi-Armed Bandits , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:fba8c115095ca7a57fb5c8605e1012bd0a18678ddd450642eaa90cec639bb22b","observation_id":"6a772d50-c8f0-46f3-b131-9d46fb0d404c","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Perturbed-History Exploration in Stochastic Multi-Armed Bandits , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:fb09bc6c5b3d50abdfa37e3ef0044040a916462983d9b0eac28db815c668249f","observation_id":"dbac412d-d0a1-481d-8ea8-41501efbb0db","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Bootstrapping Upper Confidence Bound , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:d9023fd6f795688728c2e0969f517c80955155ff8e054b81d58031ca06a78cb9","observation_id":"51f5203b-9f37-4d74-b051-29b91d343894","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Sub-sampling for Multi-armed Bandits , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:f64b78030b0191fdf2a87b623666c3167b7ecc014fc3b7eac4d69b17fd7c1790","observation_id":"01399bc1-c9ce-4010-96e8-7440140ffeaa","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Sub-sampling for Efficient Non-Parametric Bandit Exploration , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:3d8978cd745e51b5dabfdbce28039f8e5434ac34a0d13bd00c150d886fb867be","observation_id":"d7b54a57-8e3e-43e7-989b-3eae3ab226e1","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Maximum Average Randomly Sampled: A Scale Free and Non-parametric Algorithm for Stochastic Bandits , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:cc3b8e931bd6a47741c6a75e3f375196bca9bde59fb920a97e583e2d4864fb93","observation_id":"cb4651c6-beb3-4190-b78e-d3e89e128eae","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:c9f985bfdcfe9277aebd3f0fcf78cc3a0570fffb3407c94af1ac08a19181d708","observation_id":"aae30e0b-d8fd-416c-b32a-640d25d9b34d","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1111.6554","last_updated":"2011-11-28T19:18:37Z","snapshot_observed_at":"2026-08-15T04:27:34.244603Z","submitted_at":"2011-11-28T19:18:37Z","title":"On the absolute constants in the Berry-Esseen type inequalities for identically distributed summands","version":1},"cited_work":{"arxiv_id":"1111.6554","doi":null,"metadata_source":"pith","pith_arxiv_id":"1111.6554","snapshot_observed_at":"2026-07-04T03:09:30.515283Z","title":"On the absolute constants in the Berry-Esseen type inequalities for identically distributed summands","venue":"math.PR","work_id":"9e354f05-9e03-48d2-b0ad-784188753b68","year":2011},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"cited_paper":"/paper/1111.6554","citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:e53fe604d8fa5ae771dbe2bda64c8e784dbd24a04ee841bb4abeec9ddddec8d9","observation_id":"496a0020-08c4-4062-9b54-28e6c85837c6","resolution":{"observed_at":"2026-07-04T03:09:30.516795Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"The Annals of Statistics , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:e5a08319eaa967eb2217c589b058d07e4881707e051a0bab060dc2ec0c218a1f","observation_id":"e6ffe0b0-3100-42cb-a8b3-09b0533888f1","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:19:02.314185Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-26T18:19:02.314185Z"},"links":{"citing_paper":"/paper/2606.20107"},"observation_digest":"sha256:88751592b9ce1aa24d3971640e31aea240fadb6cdf2d6eef9d5a599e77140589","observation_id":"650ca7ee-5da9-4970-b03c-8f84d2b864f8","resolution":{"observed_at":"2026-06-26T18:19:02.314185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.20107","last_updated":"2026-06-18T11:30:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T07:50:16.581167Z","submitted_at":"2026-06-18T11:30:59Z","title":"Quantile of Means: A Bonus-Free Ensemble Method for Minimax Optimal Reinforcement Learning"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":52,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2606.20107."}