{"as_of":"2026-08-08T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a335c2a097d5ca0a54a6fa3e18a16ef61ec241f14a13439dc8c5ffe3eadfdc5a","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:09:21.939768Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T18:10:52.644951Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T06:45:40.553981Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"cited_work":{"arxiv_id":"2506.06521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06521","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2506.06521 [cs.LG] https://arxiv.org/abs/2506.06521","venue":null,"work_id":"8213fd20-504f-455c-8ffc-d5fa66d84e5e","year":null},"citing_paper":{"arxiv_id":"2605.04979","last_updated":"2026-05-06T14:32:18Z","snapshot_observed_at":"2026-07-06T23:17:38.226365Z","submitted_at":"2026-05-06T14:32:18Z","title":"On-line Learning in Tree MDPs by Treating Policies as Bandit Arms","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T18:10:52.644951Z"},"links":{"cited_paper":"/paper/2506.06521","citing_paper":"/paper/2605.04979"},"observation_digest":"sha256:627df2c0d65b18caa43ead8d098264b616e381e8e1e3b151192a8e2301048eaa","observation_id":"229aedfe-0a81-41e4-9f90-efbe3fc4d041","resolution":{"observed_at":"2026-05-09T06:45:40.556056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06521/citation-record","integrity":"/paper/2506.06521/integrity","json":"/paper/2506.06521/citation-record.json","paper":"/paper/2506.06521"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:23.052715Z","title":"Navigating to the best policy in markov decision processes","venue":null,"work_id":"d17db4ee-02ee-472c-972f-2ac7d67111bb","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.645313Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:444b0506795395f719f5dbcbf923fbb3242850cdb84533d8ed198c4dfa7a2753","observation_id":"752a21c9-eded-434d-be7b-0f168f5d613f","resolution":{"observed_at":"2026-08-07T06:09:23.062037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.650637Z","title":"Logarithmic online regret bounds for undiscounted reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.650637Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:1bb48a56ee01ec1717e6d6666d019145dd93dc7f704adddc9a0761d502ada5eb","observation_id":"3e9af9e9-27e2-47d8-8e8b-e7c0ff6e7545","resolution":{"observed_at":"2026-08-07T06:09:21.650637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:23.011162Z","title":"Finite-time analysis of the multiarmed bandit problem","venue":null,"work_id":"fddfe548-a5a6-489f-9da8-4a047863381f","year":2002},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.655458Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:21d2568eed34ad9166d5a65107c07956699fdd717d4ec4f2bea438ca3ea479d3","observation_id":"2f7ec633-71fd-414e-bb52-31eb330fa6ce","resolution":{"observed_at":"2026-08-07T06:09:23.022547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.660747Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.660747Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:8c8f88b43d3854e127a1b8696930dba6d3a2b4bdcc10b48b37e8335a105d5c5f","observation_id":"1560998c-4618-4634-a281-39ba3a04691c","resolution":{"observed_at":"2026-08-07T06:09:21.660747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.665444Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.665444Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:a63624484af5c17a7df3468db77a948bfbfa8d57c2fd467ff3fa96cc86d2fd55","observation_id":"e5655449-346d-46ee-9f2c-2fe69a778fac","resolution":{"observed_at":"2026-08-07T06:09:21.665444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.2661","last_updated":"2012-05-09T14:47:06Z","snapshot_observed_at":"2026-07-06T02:47:58.266745Z","submitted_at":"2012-05-09T14:47:06Z","title":"REGAL: A Regularization based Algorithm for Reinforcement Learning in Weakly Communicating MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.2661","snapshot_observed_at":"2026-08-07T06:09:21.670031Z","title":"Regal: A regularization based algorithm for reinforcement learning in weakly communicating mdps","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.670031Z"},"links":{"cited_paper":"/paper/1205.2661","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:06a37bc5f0e21b2da614d257f5765c0a21bbd2c341775fa9db589b27daf33bc2","observation_id":"e54fec24-9f68-4cf5-aa49-5f8fe58a873c","resolution":{"observed_at":"2026-08-07T06:09:21.670031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.675666Z","title":"Regret analysis of stochastic and nonstochastic multi-armed bandit problems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.675666Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:3dc06ffd67118c7c11156ddcdfaf1ef556cc6bf52601590e7de66597269f99df","observation_id":"c29630a4-0f78-40e9-887c-b334b8b794a4","resolution":{"observed_at":"2026-08-07T06:09:21.675666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.936659Z","title":"Top-k off-policy correction for a reinforce recommender system","venue":null,"work_id":"eb820811-f4f4-4fc6-b0a6-36f2b7eea289","year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.680902Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:0b02e7132b0de2f93f65580c60f6f52e549517e5c1dbae183c4637663f69f596","observation_id":"8f3663fe-4d78-4094-b5ae-d7cf90cf1a0d","resolution":{"observed_at":"2026-08-07T06:09:22.961449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13450","last_updated":"2023-02-06T19:28:32Z","snapshot_observed_at":"2026-07-06T13:14:17.806113Z","submitted_at":"2022-05-26T15:55:44Z","title":"Variance-Aware Sparse Linear Bandits","version":3},"cited_work":{"arxiv_id":"2205.13450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.13450","snapshot_observed_at":"2026-08-07T06:09:22.077430Z","title":"Variance-Aware Sparse Linear Bandits","venue":"cs.LG","work_id":"0587b27e-49f6-4df3-8e09-f04acc3cfd65","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.685486Z"},"links":{"cited_paper":"/paper/2205.13450","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:5e60ca2fa584bbaa0d976015f27ac87d64e82a5367c75d5adf04dde184e4f452","observation_id":"d1ac95b1-9f22-4f96-ae91-10a8d6604ec1","resolution":{"observed_at":"2026-08-07T06:09:22.085200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.894812Z","title":"Policy certificates: Towards accountable reinforcement learning","venue":null,"work_id":"fbaa5e24-4175-44f7-8936-6f773fa87768","year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.690575Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:cf1060ee146edddadda8d4c29b55d17a3ecb40d34f4179af8e75fc63873eaa21","observation_id":"cec2c58e-e241-40a0-9c94-fdd2d08dfd2b","resolution":{"observed_at":"2026-08-07T06:09:22.912679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.695323Z","title":"Beyond value-function gaps: Improved instance-dependent regret bounds for episodic reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.695323Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:4aa2a90d32037710940e2f072bb8353ce8b21d0bff3bdfd47d98b75e6642bd96","observation_id":"6fa8dfe2-4779-4705-9abb-c97da5ade988","resolution":{"observed_at":"2026-08-07T06:09:21.695323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.853180Z","title":"Gap-dependent bounds for two-player markov games","venue":null,"work_id":"9635e669-9a6f-403d-9dce-8b52de9e7204","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.700715Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:be2892d99c89be61e1b97b23e924b7e08efde00a79f97925ab42f830b35be391","observation_id":"60b87a59-dc4d-49ed-a24e-ebb846250806","resolution":{"observed_at":"2026-08-07T06:09:22.865549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.833346Z","title":"Cascaded gaps: Towards logarithmic regret for risk-sensitive reinforcement learning","venue":null,"work_id":"9f161fa4-2810-4a71-aced-5dd88b1e93e0","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.705363Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:f07c88ed2148a47d7d77b9799e5f969779ebd4ea1e51534d643967d4c692d8cb","observation_id":"a168d2be-fb72-4c2d-a587-6dbfc37b7b0a","resolution":{"observed_at":"2026-08-07T06:09:22.842175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.812844Z","title":"Efficient bias-span-constrained exploration-exploitation in reinforcement learning","venue":null,"work_id":"1c9bdd38-5d50-4356-8847-ed9e1c1c27ba","year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.709935Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:7f045b3ed3948023f386785099f4f78298100704ac25c1843445019dd6afda9e","observation_id":"d22e8a7b-3d5e-480c-8a43-fe6b483cb5ad","resolution":{"observed_at":"2026-08-07T06:09:22.820123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.793525Z","title":"Logarithmic regret for reinforcement learning with linear function approximation","venue":null,"work_id":"3a09b920-a378-47b0-b454-33152a0b0535","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.714557Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:7a7d0fdf0b3dfcab24bb34f1a2800a3682ca950c95666217bd701264cb83d352","observation_id":"ec4381ac-2eb4-48cf-9940-8968b0f5725d","resolution":{"observed_at":"2026-08-07T06:09:22.800170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.773774Z","title":"Tackling heavy-tailed rewards in reinforcement learning with function approximation: Minimax optimal and instance-dependent regret bounds","venue":null,"work_id":"894ac17b-e5f2-4972-be59-8aa6d24892a2","year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.719607Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:2f5136d6e62681fab53a41bbb8271d7233ba0061c9ef2ecdc67ee6afad43499f","observation_id":"0076f097-b362-4663-b39d-45d547528fa1","resolution":{"observed_at":"2026-08-07T06:09:22.780075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.723948Z","title":"Is q-learning provably efficient? Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.723948Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:356701aa7eadc0e342a17dbbe3b28d9cb672f6bae3d1b83229d06d6659b9bf31","observation_id":"4c146e2b-e269-42fb-9c88-5f62ed713de8","resolution":{"observed_at":"2026-08-07T06:09:21.723948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.742998Z","title":"Reward-free exploration for reinforcement learning","venue":null,"work_id":"f2957f95-3c81-4bf1-93e8-b36cb167fb19","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.728273Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:26bd144851846ee896a56c4a95e374524d884742625fa2a6945ed069560af490","observation_id":"aaf290a2-8bd0-4d6a-927c-49934c46ac58","resolution":{"observed_at":"2026-08-07T06:09:22.751095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.721476Z","title":"Planning in markov decision processes with gap-dependent sample complexity","venue":null,"work_id":"6438e1cc-b3c4-4040-9244-9825de97b455","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.732692Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:4d49839c579adfca9a52dd68cad169ae9fa485f7b0a84975ec9cc520c38112a7","observation_id":"4001edbd-21f0-4c19-b55c-fc39d77c45e5","resolution":{"observed_at":"2026-08-07T06:09:22.729062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.701233Z","title":"Improved regret analysis for variance-adaptive linear bandits and horizon-free linear mixture mdps","venue":null,"work_id":"4d3989cc-8075-48c6-aeed-1a02c43258db","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.737357Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:ea133926bce7d47afdc66f3141f17e4104ec26c0d389b850b268b3db0f74eab4","observation_id":"e9893598-862c-4221-92c3-14e79de722bd","resolution":{"observed_at":"2026-08-07T06:09:22.708304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.742030Z","title":"Asymptotically efficient adaptive allocation rules","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.742030Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:c1de47215a3f7a5db3a271b7037907b94afcbdd6a196e39723c159794c249ad8","observation_id":"e3b9b6b2-9766-4c14-9ef0-847e3dce72d3","resolution":{"observed_at":"2026-08-07T06:09:21.742030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.668048Z","title":"Breaking the sample complexity barrier to regret-optimal model-free reinforcement learning","venue":null,"work_id":"c5443467-33bf-4ce0-98bc-9057c3467898","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.746775Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:5fb748047ab35b5c561f6ad8567a53616b90fb821616ba093ecd56f5d9a876fc","observation_id":"e475c0b6-34e8-4d90-b0ca-53a9292c24d2","resolution":{"observed_at":"2026-08-07T06:09:22.675579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T06:09:21.751752Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.751752Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:862ef4f19fa9d8618ce3d2ed18cdb11ca4a5bc36e41b5c85c47bb8668f742b65","observation_id":"0374572d-fe69-4408-9c01-0759e382bb4f","resolution":{"observed_at":"2026-08-07T06:09:21.751752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.647298Z","title":"Deep reinforcement learning for dynamic treatment regimes on medical registry data","venue":null,"work_id":"416ededc-e59f-400f-8641-8a78af34c7ba","year":2017},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.756482Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:3707d6c10ed03b81c0db3ecca5dcdf2b97539c09063e409198f9fb5c8409b24b","observation_id":"d0a8208e-7d51-4449-b65d-cd43cbc729b9","resolution":{"observed_at":"2026-08-07T06:09:22.655567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13405","last_updated":"2021-05-10T16:40:20Z","snapshot_observed_at":"2026-07-06T09:59:26.000400Z","submitted_at":"2020-09-28T15:22:24Z","title":"Adaptive Sampling for Best Policy Identification in Markov Decision Processes","version":4},"cited_work":{"arxiv_id":"2009.13405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.13405","snapshot_observed_at":"2026-08-07T06:09:22.032726Z","title":"Adaptive Sampling for Best Policy Identification in Markov Decision Processes","venue":"stat.ML","work_id":"a865967c-9075-4f4d-9c71-2cd3eda1d93c","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.761176Z"},"links":{"cited_paper":"/paper/2009.13405","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:be57676f6e49d2ca511cae79505f78c845c724d4e977c1b78cdd38dcaca584de","observation_id":"dfa9340b-fa18-408b-bcbb-1d0b634b2f37","resolution":{"observed_at":"2026-08-07T06:09:22.039979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"0907.3740","last_updated":"2009-07-21T20:21:38Z","snapshot_observed_at":"2026-07-31T18:04:21.044437Z","submitted_at":"2009-07-21T20:21:38Z","title":"Empirical Bernstein Bounds and Sample Variance Penalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"0907.3740","snapshot_observed_at":"2026-08-07T06:09:21.766080Z","title":"Empirical bernstein bounds and sample variance penalization","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.766080Z"},"links":{"cited_paper":"/paper/0907.3740","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:57de02d29b8608cfcd18c8c4b64ed76e2c19c8c2e2a2f8dc498ce829a6ede4bc","observation_id":"82315765-0338-43ad-bf3a-22ed3b6f355b","resolution":{"observed_at":"2026-08-07T06:09:21.766080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.625903Z","title":"Ucb momentum q-learning: Correcting the bias without forgetting","venue":null,"work_id":"b422b148-80b1-4aa4-bdf9-597e5f8589b9","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.771025Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:a292002430955f4fea911e7a755d62d5696733902c624605983468bcfebad2aa","observation_id":"da871a9a-82bc-4c25-9641-0600ed1a9997","resolution":{"observed_at":"2026-08-07T06:09:22.634394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.603978Z","title":"Reinforcement learning for optimized trade execution","venue":null,"work_id":"48f144a9-e325-4532-90d6-6c033db9f847","year":2006},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.775540Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:8165af99baf373cf5148cd3a842f971c5ee4befe86cbd43ae12a2e61c933e14e","observation_id":"7e4070e2-adca-46e5-9b69-c550d4538112","resolution":{"observed_at":"2026-08-07T06:09:22.612325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.585394Z","title":"On instance-dependent bounds for offline reinforcement learning with linear function approximation","venue":null,"work_id":"46e56b0a-81b6-47d0-8087-0003fe146971","year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.779948Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:8282d30038902b4526b5511045013d5dbcf04255123d069172de227c87931ac3","observation_id":"840d6741-43ff-467c-9513-0fb223349c7e","resolution":{"observed_at":"2026-08-07T06:09:22.592062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.565051Z","title":"Exploration in structured reinforcement learning","venue":null,"work_id":"45706e41-2128-45a4-88e3-557bb9cfd9fe","year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.784415Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:9589b3ea740f7ff7dc5fbe16132866eb0544a6b67f710a8973099767a192f717","observation_id":"83035fc7-3068-41b5-9a09-6380cec19577","resolution":{"observed_at":"2026-08-07T06:09:22.572522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.544464Z","title":"Why is posterior sampling better than optimism for reinforcement learning? In International conference on machine learning, pages 2701--2710","venue":null,"work_id":"0b75d477-0947-46bd-acdd-4c8bc79b4a7c","year":2017},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.788946Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:ab576780942daf5afda4c425140a4a81cac0f55a2c36fe0735c3c3e249d5d82e","observation_id":"143457cc-037a-4666-9f5a-426af5f8d651","resolution":{"observed_at":"2026-08-07T06:09:22.552330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.524823Z","title":"Reinforcement learning in linear mdps: Constant regret and representation selection","venue":null,"work_id":"d36ab6a8-8140-497a-b17e-a99d01517ca2","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.793430Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:b4e3b33a3136f949ed2178f719e691c0820b7814d88e7edf643380e437f46f90","observation_id":"dc82e5fe-f4e1-49a8-9b08-93ef8f346b0c","resolution":{"observed_at":"2026-08-07T06:09:22.530992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.797839Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.797839Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:d03bf44f7a8018f10deaa1e24209e230bffe49f9241fe568aebcfa64ad0f1c9f","observation_id":"fdcbba15-75cf-4a2c-8f4e-d664249465b1","resolution":{"observed_at":"2026-08-07T06:09:21.797839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.802739Z","title":"Non-asymptotic gap-dependent regret bounds for tabular mdps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.802739Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:0ad46c75313c7e13dd34b01a52ae53f2e80821e85db70e11cfddf58df68f2f26","observation_id":"1c0afb3a-986d-4ccd-8bb4-e9c44f172cfb","resolution":{"observed_at":"2026-08-07T06:09:21.802739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.806964Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.806964Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:3771bf6dba362b85e3146883f5f61374f951b62f23d100cd9f55eb5cff6be7c1","observation_id":"53f03b79-cce4-4b1a-a750-b79a831414fd","resolution":{"observed_at":"2026-08-07T06:09:21.806964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.473542Z","title":"Variance-aware regret bounds for undiscounted reinforcement learning in mdps","venue":null,"work_id":"b22e19be-92f8-4cb6-b0a5-5a6884d9406a","year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.811736Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:09f2aa694f840ae9d52bf28918a27307e0ad4d95cc6dae9b71ffb62cb2cde2fe","observation_id":"ce9bbdc6-dc6b-45b5-b181-dd2192b8093f","resolution":{"observed_at":"2026-08-07T06:09:22.481576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.454092Z","title":"Optimistic linear programming gives logarithmic regret for irreducible mdps","venue":null,"work_id":"512b6902-3c55-4fe1-a373-67f6ee1c084a","year":2007},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.816074Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:d4dd312b7f7e79a75868ce197806423b854dc8b843efe9e3a08b9889ac7f1337","observation_id":"a7757793-65e0-4df2-a5bc-6aca707c4cd1","resolution":{"observed_at":"2026-08-07T06:09:22.460484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.435604Z","title":"Near instance-optimal pac reinforcement learning for deterministic mdps","venue":null,"work_id":"a27deb58-ec0c-4316-afb3-a5a0f41792bc","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.820781Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:4c53291c900f5ab4196829e0b5b94c0d9f4ba26c33db8539b929d0abdf17ad3f","observation_id":"87b74cce-14e2-47e2-a05b-8814cb258c4c","resolution":{"observed_at":"2026-08-07T06:09:22.441791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.416540Z","title":"Optimistic pac reinforcement learning: the instance-dependent view","venue":null,"work_id":"04eb0142-efa3-463a-81ea-efb41e6c376d","year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.825041Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:71d57cff3fe360306402d5b0006f238512c3433e4f756f9548101bf3f2c6dfde","observation_id":"646c21e6-60f6-4282-ba5a-dbe02e9614a8","resolution":{"observed_at":"2026-08-07T06:09:22.422810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.398243Z","title":"Reinforcement learning with logarithmic regret and policy switches","venue":null,"work_id":"3da73368-9e80-4659-84fb-e0cc71eed2dc","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.830888Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:08ca4bcb498e3f4755e6ceef0ea19d1bb8f17dc4f851e62a1e3884eb99050bd4","observation_id":"665fbd0f-d338-43cc-89fe-2f62a84c2986","resolution":{"observed_at":"2026-08-07T06:09:22.403477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.382395Z","title":"Instance-dependent near-optimal policy identification in linear mdps via online experiment design","venue":null,"work_id":"1851edef-a796-4ebd-b40b-f4e760c950ba","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.835885Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:f9d95ada150c07eaa5a8d8e7ff14d9e3dffe7193e1d3dacad6ae182398e3ef8e","observation_id":"a4fba1ab-3745-4ef1-9a60-f3f745eabfc8","resolution":{"observed_at":"2026-08-07T06:09:22.387794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.365269Z","title":"First-order regret in reinforcement learning with linear function approximation: A robust estimation approach","venue":null,"work_id":"845b5270-9e01-4b9d-bd94-6fb039a32839","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.841054Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:2404546f0bbbcadf9c81affa9ca6b02841c768b0b8854dce8633bc2b9d8ec21f","observation_id":"c96a5531-24de-4071-ac6b-bb1c7376ee50","resolution":{"observed_at":"2026-08-07T06:09:22.371017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.347475Z","title":"Beyond no regret: Instance-dependent pac reinforcement learning","venue":null,"work_id":"83212903-2f03-4b3b-9fc2-c237fd333d94","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.846110Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:c20856e533129f0cdfc73edaf383ea4996ea99ae54b39de41808066e5498cea7","observation_id":"343a71d3-ab56-4d4c-a37e-13f8cab7b505","resolution":{"observed_at":"2026-08-07T06:09:22.352868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.329425Z","title":"On gap-dependent bounds for offline reinforcement learning","venue":null,"work_id":"d6dadf33-4a92-40dc-ae28-a5b0f67d4fff","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.851766Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:b89ed56f63653a18abc6b9531a0a5fb75e640cc9859eb0f4112c202ce389ecae","observation_id":"587e52c9-d96d-4887-80a9-2f0250ffdba0","resolution":{"observed_at":"2026-08-07T06:09:22.335760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.311544Z","title":"Near-optimal randomized exploration for tabular markov decision processes","venue":null,"work_id":"50bc732e-27fe-40fe-85be-d6d599c5d874","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.857671Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:9ddc01636a7a18cc551d318fbb014f976286de1d47d9aa682df244482c314e4c","observation_id":"0c2295a7-13c1-4934-a9f2-7106bdeb9912","resolution":{"observed_at":"2026-08-07T06:09:22.318255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.293899Z","title":"Fine-grained gap-dependent bounds for tabular mdps via adaptive multi-step bootstrap","venue":null,"work_id":"e2275360-a464-45d3-9d84-127d5c413571","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.863405Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:a2ee16d363c70e26350b6e109ab000bb5caa610c34b257a572e51ea7472f5715","observation_id":"ee3fccd1-e11e-4db4-9784-a506b0ca06b9","resolution":{"observed_at":"2026-08-07T06:09:22.300451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.272585Z","title":"Q-learning with logarithmic regret","venue":null,"work_id":"bcff32cb-cc70-4ca2-a417-63ad25cb50d3","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.868774Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:f2bb99c138a7c2325d3b240f9db24095d2a2e4b0a9e1cf076a28cb1419e681f0","observation_id":"c561d791-c61e-41ee-922e-0c6d2e04dd84","resolution":{"observed_at":"2026-08-07T06:09:22.279268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.875678Z","title":"Tighter problem-dependent regret bounds in reinforcement learning without domain knowledge using value function bounds","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.875678Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:a0f41b53b3fd625f12be2542ff463952f64f9414f4492a57a79711d62bc09b27","observation_id":"e09e3872-2afb-4001-84da-90d806ce96b6","resolution":{"observed_at":"2026-08-07T06:09:21.875678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.237977Z","title":"Regret minimization for reinforcement learning by evaluating the optimal bias function","venue":null,"work_id":"ea34416e-3813-4fa8-a6d6-6dfc0e4a4a8c","year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.882653Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:512525cb578f6e1f29b849d0b971e33825e060e50dc4730bb0e43375370a2d95","observation_id":"1fdf739b-4ba0-4d61-acb9-a387c1a54368","resolution":{"observed_at":"2026-08-07T06:09:22.246652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.216018Z","title":"Almost optimal model-free reinforcement learningvia reference-advantage decomposition","venue":null,"work_id":"1f986fcb-90ae-4950-87db-88ddc7d4376f","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.889570Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:fd02d61bccf7ef81f8849e3235a154e9633c2de10e3bfd3809970154a0c62216","observation_id":"03367650-80df-4da6-97d3-4005db1289cb","resolution":{"observed_at":"2026-08-07T06:09:22.224318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.197493Z","title":"Is reinforcement learning more difficult than bandits? a near-optimal algorithm escaping the curse of horizon","venue":null,"work_id":"84acab0b-c1c1-4571-9cb8-f0389a9f8563","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.897012Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:b4814c944edf66f4668d31aed4b8c707e3c2e31020f072948e658756db9cdf93","observation_id":"a62ee762-7be0-4634-a9f7-806d703c4041","resolution":{"observed_at":"2026-08-07T06:09:22.203614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.177062Z","title":"Improved variance-aware confidence sets for linear bandits and linear mixture mdp","venue":null,"work_id":"e6ef8fa0-a05b-4015-bd6c-c090b163d013","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.903919Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:07791ad0bd3422e8fe9f9190c6ca31992475dbb897afc656d06d4254c9b649f2","observation_id":"eb10c7a5-ddd7-49d9-9810-6017f98d517a","resolution":{"observed_at":"2026-08-07T06:09:22.184382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.158135Z","title":"Horizon-free reinforcement learning in polynomial time: the power of stationary policies","venue":null,"work_id":"82c88030-1273-4b1b-ba44-cda3a6117065","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.911067Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:ca44af2633d2b81e95adafd6d0719d352ea5b44a86be9a7a06da3ed9c4fa8cc5","observation_id":"437ff0ee-9e1e-4079-b4c7-1dd3ac6a4efa","resolution":{"observed_at":"2026-08-07T06:09:22.165150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.917081Z","title":"Settling the sample complexity of online reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.917081Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:3a7f2a0a370f118a1e2f4ab30e3c50c0c48758823db88bbc20c62e751b0e378d","observation_id":"744f8b4a-6ecc-44b7-bd4a-b4cd2893f646","resolution":{"observed_at":"2026-08-07T06:09:21.917081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07574","last_updated":"2025-03-10T03:04:21Z","snapshot_observed_at":"2026-07-31T01:34:28.561193Z","submitted_at":"2024-10-10T03:19:46Z","title":"Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition","version":2},"cited_work":{"arxiv_id":"2410.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.07574","snapshot_observed_at":"2026-08-07T06:09:21.982126Z","title":"Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition","venue":"stat.ML","work_id":"d0e75a17-3a9f-4de2-a84e-32eab5035038","year":2024},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.923994Z"},"links":{"cited_paper":"/paper/2410.07574","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:4a0a5cbda0c3ab1eacad84fe9630fa1e05765dddae077604ee9479e9e2c10269","observation_id":"b1f3bd36-1d48-4a40-8458-ac15aa3701e9","resolution":{"observed_at":"2026-08-07T06:09:21.992642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.126845Z","title":"Nearly minimax optimal reinforcement learning for linear mixture markov decision processes","venue":null,"work_id":"1a6f4f15-25ef-4563-870c-1f29d254a55f","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.931913Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:b12972149d3fd1a99d185581299541e0f68c3d215dc1cae99c41660bff8d5c8f","observation_id":"a74689ed-21ec-46a7-a988-4e5560f21227","resolution":{"observed_at":"2026-08-07T06:09:22.133022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.939768Z","title":"Sharp variance-dependent bounds in reinforcement learning: Best of both worlds in stochastic and deterministic environments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.939768Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:a70e026af1de5cb80806ae85b2d978307ab9e8c36e44603241716cf61cf9ea6a","observation_id":"46abb972-bf09-441b-a206-dd59d2d18436","resolution":{"observed_at":"2026-08-07T06:09:21.939768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:52:40.851691Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":38},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.06521."}