{"as_of":"2026-08-14T16:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac367ae69a430967a581bdd907c14d7ea5dcca39e033ae372ef222bb8ac74e79","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:54:01.147324Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17201/citation-record","integrity":"/paper/2607.17201/integrity","json":"/paper/2607.17201/citation-record.json","paper":"/paper/2607.17201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.493874Z","title":"Al Marjani and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.493874Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:f2bb9ebdfb6ded5ec95c71ae429d1a97887b2b540a8cb9028735e6834faa6d60","observation_id":"7151ce36-21b7-4331-9ea6-7279ad572995","resolution":{"observed_at":"2026-08-01T18:53:58.493874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.529153Z","title":"Al Marjani, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.529153Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:960a8cf3122bf2a7bccf92b953a667773cbb96ae319eaff0d2f5af9171e4a7ae","observation_id":"06e02925-65d5-44b7-a941-788000b5515e","resolution":{"observed_at":"2026-08-01T18:53:58.529153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15342","last_updated":"2026-04-20T06:54:31Z","snapshot_observed_at":"2026-07-06T21:27:42.002746Z","submitted_at":"2025-05-21T10:13:54Z","title":"Policy Testing in Markov Decision Processes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15342","snapshot_observed_at":"2026-08-01T18:53:58.581627Z","title":"Ariu, P.-A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.581627Z"},"links":{"cited_paper":"/paper/2505.15342","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:d68b028d596f103ec402094d407f130d14919952d8db8a4a4de6116605fc80b3","observation_id":"eb8f7d5f-4cd3-4159-bab6-483cb77255c7","resolution":{"observed_at":"2026-08-01T18:53:58.581627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.645968Z","title":"Berge.Topological Spaces: Including a Treatment of Multi-Valued Functions, Vector Spaces, and Convexity","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.645968Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:292c513849a6c8d5793a39b87016bd2b4fb7badabce1477e469e45b91b51b499","observation_id":"5db72b6e-b558-44fb-84bb-66656e05f635","resolution":{"observed_at":"2026-08-01T18:53:58.645968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13013","last_updated":"2025-01-22T16:56:42Z","snapshot_observed_at":"2026-08-13T17:40:59.477429Z","submitted_at":"2025-01-22T16:56:42Z","title":"The regret lower bound for communicating Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13013","snapshot_observed_at":"2026-08-01T18:53:58.706383Z","title":"Boone and O.-A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.706383Z"},"links":{"cited_paper":"/paper/2501.13013","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:0354085614833c553e580f80fa986e86f22867afac1ecd653e85b88d85a69efb","observation_id":"d909eea6-b31c-4031-a7f4-2b717132859b","resolution":{"observed_at":"2026-08-01T18:53:58.706383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.770229Z","title":"Boucheron, G","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.770229Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c5e83c842f73aa5a58711be48bf54be0d741e4ef78ddc6a74ee2ccd7920aaab8","observation_id":"57780a37-c1e1-4079-bbe6-c2a72904419b","resolution":{"observed_at":"2026-08-01T18:53:58.770229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.826541Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.826541Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:8e5649bce4d09bcf28c2e8c6dd07269a2ef93a4ebdf44dda79ba736751eaf82c","observation_id":"35b958e0-4312-4ee4-8b38-d8bd4a94e922","resolution":{"observed_at":"2026-08-01T18:53:58.826541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0024-3795(01)00320-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Linear Algebra and its Applications","work_id":"33a72288-f553-41a4-9f2d-ad7007a613af","year":2001},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.871081Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:983582205b22a1da098ab024baa1e949b5d8c9d3b4c8ab1c37d5d9e609961474","observation_id":"cc0fdbbe-2b6f-468b-9fab-af3a2ff57e66","resolution":{"observed_at":"2026-08-01T18:59:12.738112Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.945774Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.945774Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:ceb825d128f8b726feeede813ca1fa0a287378551159ef4b905b88d4b0076cc7","observation_id":"c7876929-fb53-45a4-9151-039a347cdc81","resolution":{"observed_at":"2026-08-01T18:53:58.945774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.009892Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.009892Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:bc4e72a001ba85188b61f8e30d8f362cdda762d800da0e13e56f32486f238018","observation_id":"89863d45-3678-4211-85ce-8f2e6f2a8cd6","resolution":{"observed_at":"2026-08-01T18:53:59.009892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.116553Z","title":"Degenne and W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.116553Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:85c128db90b13382e450116db69bf6ed08a670f6265897cd9c31e3cdce661e6e","observation_id":"8f0bcc96-f663-41c7-b677-5d9384688533","resolution":{"observed_at":"2026-08-01T18:53:59.116553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.167718Z","title":"Degenne, W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.167718Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:77102b84a8ae02d8c4e0abfc14648bd9c5610d82f12432f28668001dff0a9dd6","observation_id":"b9d2103a-99e4-478c-a38f-eebcc5d336bb","resolution":{"observed_at":"2026-08-01T18:53:59.167718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.262719Z","title":"Garivier and E","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.262719Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:461c3560f5be3e3ba7f61ef0bb0082b7ed0143fc85cff7852ad899b15cee0980","observation_id":"3d740a2c-859d-47ca-859f-242de7a9d63c","resolution":{"observed_at":"2026-08-01T18:53:59.262719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04454","last_updated":"2018-07-24T08:38:39Z","snapshot_observed_at":"2026-07-06T06:09:05.613678Z","submitted_at":"2017-11-13T07:36:01Z","title":"Thresholding Bandit for Dose-ranging: The Impact of Monotonicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04454","snapshot_observed_at":"2026-08-01T18:53:59.352381Z","title":"Garivier, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.352381Z"},"links":{"cited_paper":"/paper/1711.04454","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:7418e3cc57b9a8355bafdab6ebcbd9ff0ee02fd1a6a5bb36c86958152d84aa86","observation_id":"03a5005e-b5c8-4b51-affd-a8ca7f56596f","resolution":{"observed_at":"2026-08-01T18:53:59.352381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.442412Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.442412Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:d77fd4d030f2925b33a3e14be6ff9b77a1cea0ffe69dc2eb0bbe81a82763923f","observation_id":"ea5a2da7-1be2-42c6-90c7-e54f0ed970c6","resolution":{"observed_at":"2026-08-01T18:53:59.442412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.452766Z","title":"Jonsson, E","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.452766Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:e167f4d5870b3c5115d3a1fe369ba1093d60582affdc1f006244bad3f3f0fb15","observation_id":"0932b424-0528-462e-8a90-dcd389e59d9f","resolution":{"observed_at":"2026-08-01T18:53:59.452766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.511504Z","title":"Jourdan and A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.511504Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:354b376457307581f36c1e6e5403a4802004d223fa0356fe852f5cfb51c047ae","observation_id":"1d2e93fe-fe6a-480f-ab5a-d8737b0ea7cb","resolution":{"observed_at":"2026-08-01T18:53:59.511504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.578201Z","title":"Jourdan, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.578201Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:2e07c43a6c37ccfdb72b7e9b108269791f18dc168051ed056476222193870337","observation_id":"1f0be86c-19be-4cb5-8176-6cacd2e5c25f","resolution":{"observed_at":"2026-08-01T18:53:59.578201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.692268Z","title":"Kaufmann, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.692268Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:d05dfcc6e979b33b4e828e533748e19bada1035d0f2bbcde224bb5febfc10193","observation_id":"57eccf5b-b2b7-4de4-970c-f440032526d9","resolution":{"observed_at":"2026-08-01T18:53:59.692268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.790934Z","title":"Lazzaro and C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.790934Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:41767316880affff01b298c8bc322e789a7eeea0ba5844136e065058b944d16a","observation_id":"d906c45c-3b27-448f-be8d-5343fa621c18","resolution":{"observed_at":"2026-08-01T18:53:59.790934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.854229Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.854229Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:441c765d7c28cd59a6927cda6aabd12050b4cfb9bd0e27f503ddfb6801e53e84","observation_id":"842bcfb4-453a-442e-882f-d3e4cf19f9a7","resolution":{"observed_at":"2026-08-01T18:53:59.854229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.941681Z","title":"Poiani, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.941681Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:089c569eeb5757c42647670038de92b7003c88b78d4d12971805c6773833148f","observation_id":"dc50e33e-8360-45a6-9365-1d9cb6cbf796","resolution":{"observed_at":"2026-08-01T18:53:59.941681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.031409Z","title":"Poiani, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.031409Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:2459e6205013045bb0f855533669962e09cf8799a96b707b3f5804e565ea2110","observation_id":"10d17296-4c7f-4280-b064-9b74ca0f8251","resolution":{"observed_at":"2026-08-01T18:54:00.031409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.132912Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.132912Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c48d45362cb65b5a3cdabde0474a5168f81b4a83118968db08765387accaa59f","observation_id":"a3557330-acb1-4377-9e61-ef785a6d2b92","resolution":{"observed_at":"2026-08-01T18:54:00.132912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02516","snapshot_observed_at":"2026-08-01T18:54:00.193317Z","title":"Russo and A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.193317Z"},"links":{"cited_paper":"/paper/2502.02516","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:8f681d88f8796e7216476613c7f86ea88c263f38b7a6807d5aca9d6b4788dbad","observation_id":"661319d6-b19e-4270-8ce8-866f141e0195","resolution":{"observed_at":"2026-08-01T18:54:00.193317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.274126Z","title":"Russo and A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.274126Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c36ccd0ce876db9d68252b6828be7ec44e6cc871a83ac1eba1a581b1b76fe5f7","observation_id":"1b4326d2-0013-4adf-a545-e70733671d2e","resolution":{"observed_at":"2026-08-01T18:54:00.274126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.432674Z","title":"Russo and F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.432674Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:1ffb4273125f2308e119bb4707be6566856fe3822cc62eb6f02af52b4cb3eb9c","observation_id":"224278e4-ab14-4781-9513-404ffd466581","resolution":{"observed_at":"2026-08-01T18:54:00.432674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07824","last_updated":"2025-03-10T20:11:59Z","snapshot_observed_at":"2026-08-07T17:15:31.344888Z","submitted_at":"2025-03-10T20:11:59Z","title":"Pure Exploration with Feedback Graphs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07824","snapshot_observed_at":"2026-08-01T18:54:00.626153Z","title":"Russo, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.626153Z"},"links":{"cited_paper":"/paper/2503.07824","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:eeb82d19aa59b70ff0eda30e1ce5e86cc261030ae93e3fc391893d8bfdbe5b5e","observation_id":"f0043074-c72f-4304-8351-3d4601eaf280","resolution":{"observed_at":"2026-08-01T18:54:00.626153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.721970Z","title":null,"venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.721970Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:cf021f24ed96980b28b4ecbc7a30862a196a54e38194ee52c6dd0948115b623e","observation_id":"2db139a3-37fb-4422-b44f-c4ca9c94165a","resolution":{"observed_at":"2026-08-01T18:54:00.721970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.17587","last_updated":"2026-05-29T10:41:53Z","snapshot_observed_at":"2026-08-13T23:18:21.436210Z","submitted_at":"2026-02-19T18:11:02Z","title":"Asymptotically Optimal Sequential Testing with Markovian Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.17587","snapshot_observed_at":"2026-08-01T18:54:00.796549Z","title":"Sethi, K","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.796549Z"},"links":{"cited_paper":"/paper/2602.17587","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:65f46ead01a867fcccfb49d0f01dd3fec8da85f18d027ac31903e02bc29a8ed7","observation_id":"50d7c8a2-7619-4abe-9d3d-2db699ddff46","resolution":{"observed_at":"2026-08-01T18:54:00.796549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.837113Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.837113Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:23b27ed1a2cc6cd6efe8ddc37738ecbdf90c3490b8e5252e3438a6a1c5b55075","observation_id":"c8a9d37c-bec9-4521-9c69-4ffcc2cfc9e0","resolution":{"observed_at":"2026-08-01T18:54:00.837113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.883532Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.883532Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:897937059e91074c824af6f09f4496d98c943dad2de49a163d7e381f0068ac28","observation_id":"a29c040a-498a-4498-9d0d-dd22925ba511","resolution":{"observed_at":"2026-08-01T18:54:00.883532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.937068Z","title":"Taupin, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.937068Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:bde75a3f81793b61b24d92fd28a961f07fa2bd58dc0bc4c08ae4cdfb98b90f60","observation_id":"73eadf8b-3c6d-4b0a-bfa7-1eb5171673f6","resolution":{"observed_at":"2026-08-01T18:54:00.937068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.975367Z","title":"Tuynman and R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.975367Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:50f9aaa490a5615dd27fb428fd4663cd9e151b8a812e1ade3b588334f26fa777","observation_id":"78ae6ba3-d871-475b-9c6b-9e31467066b0","resolution":{"observed_at":"2026-08-01T18:54:00.975367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:01.031230Z","title":"Zalinescu","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:01.031230Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:5a118a003dc8c5790e8450243f729ae7437fc8c23efc1b4f84966033d3d57a3b","observation_id":"dc1d2a00-e8be-4281-88aa-fd7bc1184742","resolution":{"observed_at":"2026-08-01T18:54:01.031230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:01.101340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:01.101340Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:99c5dfa126118fcbe965cab3e851a4b5d2db2983b50440331b5c0436aab2d413","observation_id":"e79e6aa5-05e1-4189-afa2-4290b4bd6dd3","resolution":{"observed_at":"2026-08-01T18:54:01.101340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:01.147324Z","title":"Lemma 42.Let Ω⋆(M) := ( ω∈Ω(M) inf M′∈Alt(M) X s,a ω(s, a)KL(P(s, a), P′(s, a)) = (T⋆(M))−1 )","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:01.147324Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:1fe66960a3669d5ff6f48a6797b6e880a0a9b65732f387965aa6ad5818234708","observation_id":"c115e5c2-e857-4ce1-92bb-b79578246156","resolution":{"observed_at":"2026-08-01T18:54:01.147324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.17201."}