{"as_of":"2026-07-31T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:973e62dcd296d23c6c53468f595a6e14028d430b69dad55802381bbfc6f9662f","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T15:44:02.195783Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-31T06:34:12.847434+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.05791/citation-record","integrity":"/paper/2605.05791/integrity","json":"/paper/2605.05791/citation-record.json","paper":"/paper/2605.05791"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimistic posterior sampling for reinforcement learning: Worst-case regret bounds","venue":null,"work_id":"fc3e9e13-702a-44b8-9ad9-749dd76d7e94","year":2017},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:1ea0b35dd029ad3f2cfb92f680ace09899e1b9a201462584e261a09e435e51cb","observation_id":"b1ae8dfb-5bb3-45b2-836f-d570da5bf619","resolution":{"observed_at":"2026-05-26T01:06:26.322555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"fa7e6a0d-7c55-4e1c-9177-43e7aa76de30","year":2008},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:bf25fa39cecd93fa45dbc6f31ba8b24ad3dd6da7b9fe700f1ed2c9255aeff2f2","observation_id":"c1a8919b-3210-4821-bd10-b630a18ad11f","resolution":{"observed_at":"2026-05-26T01:06:26.325556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":"aa3bc240-3cb0-44fa-8b0a-e28beb97827f","year":2017},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:edde57298396a3833b4d8a632d9e6b00d83cf87194acf0b411c8da28f2dc40c6","observation_id":"f3091fcb-e355-45fc-9025-b40a1df186cd","resolution":{"observed_at":"2026-05-26T01:06:26.330641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering the game of no-press diplomacy via human-regularized reinforcement learning and planning","venue":null,"work_id":"246e239b-606c-422a-a105-3825946ed4af","year":2023},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:6087d762a3d398bc717631fa3a15307166af21f2387f73ea8fa9712468b89a14","observation_id":"897c28ae-8703-4ca9-94d0-3a7791c9a819","resolution":{"observed_at":"2026-05-26T01:06:26.316031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bartlett, Dylan J","venue":null,"work_id":"bc3d1688-3b05-48fb-a708-6ac21ef39eac","year":2017},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:bffcc31efb9d32d1f5cf1b7494761cb64a1ee83ca793cb3c78a90b80c838bcc5","observation_id":"519f5cf9-f73b-4aba-af13-f9f783e9f9c4","resolution":{"observed_at":"2026-05-26T01:06:26.311009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertsekas","venue":null,"work_id":"d533f518-7a0d-4140-8f2d-f688d59851f9","year":2025},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:dfbcb22345f4302384b8131ef77a6cacc0bd8532ecec762c085a31cb347f0fc1","observation_id":"fe5d2fbb-c30c-42f0-b650-7da941acc247","resolution":{"observed_at":"2026-05-26T01:06:26.357083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertsekas and Steven E","venue":null,"work_id":"11e08a02-a35b-4af9-a450-932f3bdec13f","year":1978},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:17033e30743db03bbb54c748067d5fc2ac60373603276ba839bcda0a370f6227","observation_id":"74e84a5d-9914-4a6f-8784-ed360cbf9e41","resolution":{"observed_at":"2026-05-26T01:06:26.229472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertsekas and John N","venue":null,"work_id":"dc05b444-afa9-4da3-8f92-c27ec9e3938b","year":1996},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:96a31a78b756bd07de7cab77a5a31d1753549dfd36612234190065493eab0e9a","observation_id":"e1ca5152-09ed-4f2a-afb5-e3bb032a6975","resolution":{"observed_at":"2026-05-26T01:06:26.288235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomes, and Kilian Q","venue":null,"work_id":"8da7ac54-1708-4082-b68c-32b95e3f1a01","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:4446195b22140caae9abb1f7f49f3d932e156b796030c2d4c17811b10ed78eeb","observation_id":"32012686-8901-42c7-a6fd-bc6521fe02bb","resolution":{"observed_at":"2026-05-26T01:06:26.232267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discounted dynamic programming","venue":null,"work_id":"2db3610c-66b4-412f-9df1-446ad6405685","year":1965},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:34ad381b66382afec6a5f3412311723af86d5303e5edf2d9db3f92e978de62bb","observation_id":"b2dc5a1e-3e65-452b-a2ae-2830c7cba317","resolution":{"observed_at":"2026-05-26T01:06:26.406621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R-max - a general polynomial time algorithm for near-optimal reinforcement learning","venue":null,"work_id":"b7ae2826-da8b-4128-b974-451b52438812","year":2002},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:058a0a084da5db1a17331d72f44303f436f24466a8e8fa616f8b044eb59ede04","observation_id":"743b01f3-01a5-40bb-8a12-5460e851465e","resolution":{"observed_at":"2026-05-26T01:06:26.377490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"432539b9-e3b0-40dc-a041-7e27a8a94814","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:01a2931711e00e680008ecc77631f966f17172c242c7b361ba835e3f34e0add4","observation_id":"ccf93b47-2938-4a21-808c-62470bd3fdc8","resolution":{"observed_at":"2026-05-26T01:06:26.347822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":"856c4a6f-df76-42f9-9711-a31aade0dbc5","year":2022},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:901534d63f92ab17e9cc02b2d2941a1f476dda1ce482e23b3a6433879ec4df06","observation_id":"0b485bc1-202e-4432-8b73-6a11b0ebabd1","resolution":{"observed_at":"2026-05-26T01:06:26.235676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based reinforcement learning: A finite-time analysis","venue":null,"work_id":"43ab1975-db1e-4646-95f1-2420edffa76c","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:0ecc4fcd04a9e0778fbf97d99f632ede940d21f8c5c6fd57d585a6c3bd1b98ae","observation_id":"521cd7da-d148-47e8-b606-7e0c51d893aa","resolution":{"observed_at":"2026-05-26T01:06:26.350928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provable model-based nonlinear bandit and reinforcement learning: Shelve optimism, embrace virtual curvature","venue":null,"work_id":"c2d8b6b3-839a-454a-a284-6cb277b9614c","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:8e62fb4a048f6bef41cfb8e9de641a3f41bb68bf58f3c471ce890b1cdd5672f9","observation_id":"cd6d747d-3355-43d1-bb20-cf1fe3879fc6","resolution":{"observed_at":"2026-05-26T01:06:26.223175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bilinear classes: A structural framework for provable generalization in RL","venue":null,"work_id":"2a3e3f10-edba-459d-b734-07cbf2fa5d0c","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:0795b391b6609c6bf1f9ad163e29134e97d3fa63081aab5492f6ae0b09c321db","observation_id":"5de3bf24-f4b3-48ab-aae0-e3d39cd678a3","resolution":{"observed_at":"2026-05-26T01:06:26.245101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Risk bounds and Rademacher complexity in batch reinforcement learning","venue":null,"work_id":"da5c6772-45f8-446f-afcd-b52b0e7ee061","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:67ddbafecef569608d359eabf07d8726199d939c6edd12ae0d7760929f28e04d","observation_id":"60a2d0d4-885a-4c57-9870-f797946f707f","resolution":{"observed_at":"2026-05-26T01:06:26.398121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with Gaussian processes","venue":null,"work_id":"d47fa7da-5230-434d-9529-dffa48da935f","year":2005},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:310d1bbb3b376dad45c931c05cc1db027a5810f701e404afdb15d40753a91f07","observation_id":"9e9d45e5-f20d-4fde-af40-c4c9b569229c","resolution":{"observed_at":"2026-05-26T01:06:26.272086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level play in the game of diplomacy by combining language models with strategic reasoning","venue":null,"work_id":"7e773871-84bb-4a52-bf71-e75371d6a1a7","year":2022},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:93e06cf7bcd0c2ac0d8484dd97effe12d04c8658a2baa641ddd02bbec06d49fc","observation_id":"c68325f5-ed2e-432e-8f6c-b168138d2f8b","resolution":{"observed_at":"2026-05-26T01:06:26.266768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error propagation for approximate policy and value iteration","venue":null,"work_id":"97e6c406-2ff9-4b70-92df-08865a493dc2","year":2010},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:ff4ba6ab4b81088e1a2a3ce173478afc3d87b33ce7dbd911264d15277a079f95","observation_id":"440a82da-5ae4-454f-98e1-c858015aad24","resolution":{"observed_at":"2026-05-26T01:06:26.395132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Average cost Markov decision processes with weakly continuous transition probabilities","venue":null,"work_id":"ce2ca2bf-5fce-4249-9330-6d7a8c1c76b0","year":2012},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:8bb0891e3658792fb7375451b901bea4a414f6d2a23bee766da1db1b0844d8bc","observation_id":"ba043d90-4c2a-4c08-96df-6dbe61577529","resolution":{"observed_at":"2026-05-26T01:06:26.291209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13487","last_updated":"2023-07-11T16:47:42Z","snapshot_observed_at":"2026-07-06T12:22:32.240903Z","submitted_at":"2021-12-27T02:53:44Z","title":"The Statistical Complexity of Interactive Decision Making","version":3},"cited_work":{"arxiv_id":"2112.13487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.13487","snapshot_observed_at":"2026-07-04T10:09:44.784535Z","title":"Limitations","venue":null,"work_id":"acfee5c7-1660-4c22-af44-7051eb52bc00","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"cited_paper":"/paper/2112.13487","citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:02df30766885f25cc47e77a1d8beac7b53184fbda4de8e8d2e6aeb2f3adca14b","observation_id":"c1d7bca8-0efd-4e66-84e4-bf20ff7760ce","resolution":{"observed_at":"2026-05-11T16:36:09.943214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foster, Akshay Krishnamurthy, David Simchi-Levi, and Yunzong Xu","venue":null,"work_id":"89565251-7a0e-4bac-9764-45306aa0d217","year":2022},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:f1796ee823cdbc6bdb341a6da4c7703db6c7d0693b118c745cc3437a5eb89bae","observation_id":"ef247747-d978-48d4-923f-262f1b6d978f","resolution":{"observed_at":"2026-05-26T01:06:26.409882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"ccf7a300-e038-42d7-9bdd-df4684e2327c","year":2018},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:f5a06a902aa88657c6f63852863a774dc9397a40d21fbe336d9ed385f4d1e0bc","observation_id":"d073014f-50a4-4efd-ac03-72d647e5a069","resolution":{"observed_at":"2026-05-26T01:06:26.380275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A theory of regularized Markov decision processes","venue":null,"work_id":"fd8ccab6-2736-4bac-9c18-9a00dae4743e","year":2019},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:5bc56f0a7ac7f5843b905571f15e4192fc2b86bd470d87daf0d779029ac51ccf","observation_id":"547d289d-815f-4b06-9658-1761e0918c2f","resolution":{"observed_at":"2026-05-26T01:06:26.251680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spectral normalisation for deep reinforcement learning: An optimisation perspective","venue":null,"work_id":"2b232fe5-4783-48c0-a49a-5333071a82da","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:171961a872ffc01203079ad23038576d5a2a4ced5b9f504d2c3a897d5e942a05","observation_id":"0a432abb-cf91-4f23-9bfc-7f7c24d6074d","resolution":{"observed_at":"2026-05-26T01:06:26.388065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Size-independent sample complexity of neural networks","venue":null,"work_id":"be300346-2741-43a7-9ee7-62a6464b5d3c","year":2018},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:e266894cff11f44c90a519fd79c9564f076fc454dacdb530c224cfc853e2392e","observation_id":"50907821-f764-4d94-b49a-70addb183c10","resolution":{"observed_at":"2026-05-26T01:06:26.299975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable function approximation in dynamic programming","venue":null,"work_id":"59b160d9-324e-4e6e-8152-d8278bf867ec","year":1995},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:826e34753974c0c99445c1ec396ea1385b21719f308b0e27f8c006a82420289c","observation_id":"42f288cb-5c6a-4ce7-98ab-28fa68b556e2","resolution":{"observed_at":"2026-05-26T01:06:26.293876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"47282571-e312-4702-a60c-cbce5aa6efc0","year":2018},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:e2a619c08897efca2c8b4b63d1eb5219a35fbf4004b2701bfa6c547aaf450da5","observation_id":"76583532-a526-4ac3-bd59-58110d08cdd5","resolution":{"observed_at":"2026-05-26T01:06:26.304905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lasserre","venue":null,"work_id":"7c38e1f1-9b13-44ff-95fc-bac8b059bc3b","year":1996},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:e404844d308e5e476a41d56ede44d6d7779eb7397ccf88d9288b9d4c66874e2b","observation_id":"af4830cb-a08e-4152-b305-fa1c5c79c06e","resolution":{"observed_at":"2026-05-26T01:06:26.296505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lasserre","venue":null,"work_id":"ee1b0bac-ef8c-4803-b75b-8e62d64f10e9","year":1999},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:f4870545077d8773ec7e1f50e5fa485553330283362ba3582efad136a975aedd","observation_id":"a90d1bae-713b-45ec-873c-37019f51dd2d","resolution":{"observed_at":"2026-05-26T01:06:26.307965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contextual decision processes with low Bellman rank are PAC -learnable","venue":null,"work_id":"3bdb395f-5789-44c5-9b30-5066041fb129","year":2017},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:d357230508653de65e2a06f9a4ea2eb024d777247aa98cd23335560df2385e01","observation_id":"70f94b68-9692-4930-93be-636ede5e6c9a","resolution":{"observed_at":"2026-05-26T01:06:26.277490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":"46918f21-dd8c-495c-87ed-ef6789d73e72","year":2020},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:911f2ee52f71de6c55b98f41263dce3138ae590f6c34b7b96292a4adaa315afc","observation_id":"03f46a25-2e7e-4505-af21-432566a8218e","resolution":{"observed_at":"2026-05-26T01:06:26.383125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bellman eluder dimension: New rich classes of RL problems, and sample-efficient algorithms","venue":null,"work_id":"c3485ebe-0274-4a7a-99ca-3745c09b5f82","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:dfb80ed956b4f15cf113907039dc7dba02e0483361f5da6c8727b741e8081714","observation_id":"6c2599e3-9136-4690-af11-038d7bdfc72e","resolution":{"observed_at":"2026-05-26T01:06:26.344765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"d2c6a879-452f-4b7c-9425-04c2f8d38e20","year":2002},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:4cbdf6a435fa6f9dcb4dd35d5507a6af8b51cc4bade8a6280c7e05e032a32a62","observation_id":"113fb8fb-a674-48c0-9e9a-c517096b1780","resolution":{"observed_at":"2026-05-26T01:06:26.336767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Near-optimal reinforcement learning in polynomial time","venue":null,"work_id":"2f603f7d-0bd6-4187-ab58-04c47a340ae0","year":2002},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:6042182d578307d65e42fef0ff8f140010d472193fe1794455044377b8b5c1ae","observation_id":"2d5f05e2-c996-4695-baaf-bde1e71e2355","resolution":{"observed_at":"2026-05-26T01:06:26.367247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spectral normalization for generative adversarial networks","venue":null,"work_id":"212e32b9-6107-4a77-8ae1-afc63074ba5e","year":2018},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:1dd73112197ad7936d318af1c5e961d6252673c00be17fb23920124059cb4b99","observation_id":"6d0aa6fc-f2e3-415a-aa59-8fa841c5e5bb","resolution":{"observed_at":"2026-05-26T01:06:26.285287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"aae33d6d-6aad-41a1-bf6d-b36b2e1a90e6","year":2015},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:8005fb9b283cfedd0da9ec8e5767dacfc38e66c846452718ec2ff555f1c35e81","observation_id":"b596eccb-cb0b-4bda-b60f-1a912822e294","resolution":{"observed_at":"2026-05-26T01:06:26.319310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error bounds for approximate policy iteration","venue":null,"work_id":"8c702141-cf25-4332-879f-a924de8e001e","year":2003},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:4ebce1521195ec9921ae209325b58a80a3c592901b8f12e3c706e2dc0bc5d9cb","observation_id":"d24ea03e-cc84-4a5d-8e64-b4bd769686cd","resolution":{"observed_at":"2026-05-26T01:06:26.361141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Performance bounds in L ^p -norm for approximate value iteration","venue":null,"work_id":"dddf9e7a-ad15-44c0-8979-4277cdf5f46e","year":2007},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:775b7e3cec3f3fd6b29f9bc7099435d1af31fedf121a1a5e56ffa0e76c107714","observation_id":"7b8d8a5a-905c-4e10-a5c4-e895b104da35","resolution":{"observed_at":"2026-05-26T01:06:26.263917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-time bounds for fitted value iteration","venue":null,"work_id":"d4c976bc-1f43-4bec-a223-d968a4a9bdb7","year":2008},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:f4e9bb35db9b14f3464953dda75baad3b64eff68fd2de6a576ebbe7299fae30c","observation_id":"10e415ad-38d0-42f6-b0aa-8812e5788d82","resolution":{"observed_at":"2026-05-26T01:06:26.274771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based reinforcement learning","venue":null,"work_id":"6415ffbc-8593-4ae4-8677-525c06dfc57c","year":2002},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:3f74cf74ede31eb7d38cbfeca55581f455d569b0267ebdf7afc9e85586b66988","observation_id":"f663f7d3-71a1-4558-a26b-58661a259ff4","resolution":{"observed_at":"2026-05-26T01:06:26.258253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(more) efficient reinforcement learning via posterior sampling","venue":null,"work_id":"8075c813-5a78-4c81-aa98-c6f81d89b2e4","year":2013},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:a28f24df60cf87dfc87525b6e1e2431ca0fd65fb76e7c4ea675b52a3735cffc7","observation_id":"78637ddd-93f6-4705-ba10-1b5f14686acf","resolution":{"observed_at":"2026-05-26T01:06:26.371166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online learning via sequential complexities","venue":null,"work_id":"331aefc1-3774-4e24-b429-f966960ff100","year":2015},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:195f3324327a5152a557673e27085a2d205a059d75c24b7bbaab9e4be4de57b7","observation_id":"25a8eccf-0410-44ce-a06e-3e0620701e08","resolution":{"observed_at":"2026-05-26T01:06:26.280440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging offline reinforcement learning and imitation learning: A tale of pessimism","venue":null,"work_id":"a3b47aa0-fd4d-4ef0-a6b6-ed71f840486d","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:0415822ad45282256c17c7b74069b6e11086763bd52445b26e273bc90113d167","observation_id":"f42dfdb5-4875-47a0-b53b-0fe68eb0f242","resolution":{"observed_at":"2026-05-26T01:06:26.413708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eluder dimension and the sample complexity of optimistic exploration","venue":null,"work_id":"ff042108-e96a-4c6e-a6ed-2bb930c74e16","year":2013},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:cdc1c4972b2c16b21f301b4531cd676180a21dc94e3266a7a0ad9938445aed99","observation_id":"94eb0723-8515-47f2-9b54-0aec6e0442d7","resolution":{"observed_at":"2026-05-26T01:06:26.269513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"a l. Conditions for optimality in dynamic programming and for the limit of n-stage optimal policies to be optimal. Zeitschrift f \\","venue":null,"work_id":"a8a11de0-ddf7-4109-b226-cf381671340e","year":1975},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:ada27250b0b87f71b1bc0a8ddefee6543307506f33925f9fc256b1ad453ea582","observation_id":"a7cbdacb-8cf1-4ca9-b6e0-bb3da04c50cd","resolution":{"observed_at":"2026-05-26T01:06:26.339412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximate modified policy iteration and its application to the game of Tetris","venue":null,"work_id":"caec973a-f0e0-4da8-9158-02b858e28343","year":2015},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:2f2d1b50a8f3d4664f6dba23619e90f1f33e0703205731fb5db2441002b6378f","observation_id":"ecc6379e-502f-42af-b0e0-72bb08616b95","resolution":{"observed_at":"2026-05-26T01:06:26.334005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Devon Hjelm, Aaron Courville, and Philip Bachman","venue":null,"work_id":"9301890c-4fa3-4544-9ffe-b0f99d04a546","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:6b1aef159dbe99aa4a6eda10665db32156b8e40941f83c5713eb15af313aef4f","observation_id":"8bc49cab-d57c-4a2d-bd5a-2882f791dec0","resolution":{"observed_at":"2026-05-26T01:06:26.216853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering the game of Go with deep neural networks and tree search","venue":null,"work_id":"5756722d-f1d4-45b2-a336-3ed1314022ed","year":2016},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:1e2324b4421b6bbcddb729ea35bbd90fb19524d35f2764c378756b0925ad31ab","observation_id":"c40c3e13-b940-479f-b4b8-910b07a1e96c","resolution":{"observed_at":"2026-05-26T01:06:26.254965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CURL : Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"aacd17a1-1ea7-4db6-9319-f3f81e9f3769","year":2020},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:e7f0df594cda95ae4dfda4d9d0714775543dcf94b94fc68dcd96fecff6587fb0","observation_id":"d0a75709-9d72-4536-8268-918a4f0aefef","resolution":{"observed_at":"2026-05-26T01:06:26.374282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupling representation learning from reinforcement learning","venue":null,"work_id":"16c0558c-5300-4650-a366-d12556a957bb","year":2021},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:777d0af7f1d32aeb0e1733ad83eadc3f30a194a7c3e016d1890fafba1b8cf28f","observation_id":"6980bb18-66ce-4320-b1fa-35dfff5a9328","resolution":{"observed_at":"2026-05-26T01:06:26.261040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Negative dynamic programming","venue":null,"work_id":"caf73a9b-787a-49b7-9bb2-e111917bf446","year":1966},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:072d4cb625f6244480b39f1ff300e4b97b08398ae194bdf368b79ef264beb743","observation_id":"7d458331-e9d1-4369-94aa-c5b959e080e5","resolution":{"observed_at":"2026-05-26T01:06:26.226634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimistic posterior sampling for reinforcement learning with few samples and tight guarantees","venue":null,"work_id":"4337a3c5-76f1-40ed-992d-6ade7e1806d8","year":2022},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:3b8bf043dd10591084fea18d15722012ab5b7efe8b4db0d0243dbc76b05bf2c7","observation_id":"f6f0b7c5-799d-4330-bf46-20ddc45462b6","resolution":{"observed_at":"2026-05-26T01:06:26.391856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From Dirichlet to Rubin : Optimistic exploration in RL without bonuses","venue":null,"work_id":"0b9a0532-fe01-436b-a151-385c8365e089","year":2022},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:158889e46b2c8ee830c5f81c3d5a463d93cc16c2c0aaf2aacecbd1d7472821d5","observation_id":"4958b48e-bf46-4584-b4b8-f3ff4cf7bf80","resolution":{"observed_at":"2026-05-26T01:06:26.353770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analysis of temporal-difference learning with function approximation","venue":null,"work_id":"47a25ede-1c79-4ef9-936f-a5df975c17ca","year":1996},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:e4fe0c1c755854b13f46801fda649202c60c388fe894e529ea94df277a556552","observation_id":"caed532b-19a6-421b-8213-94b18ecd769f","resolution":{"observed_at":"2026-05-26T01:06:26.211306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernelized reinforcement learning with order optimal regret bounds","venue":null,"work_id":"3c6dbdd2-9303-4f9b-b8da-50ac41038607","year":2023},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:a9fcaf98cd772611505a30254375df0b5d1f5b563a903a05092c463f2965a39f","observation_id":"40ff3a06-8940-44aa-b17e-a03171e6164b","resolution":{"observed_at":"2026-05-26T01:06:26.238224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grandmaster level in StarCraft II using multi-agent reinforcement learning","venue":null,"work_id":"ee716b32-6883-4151-8449-a610106d4071","year":2019},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:f357a8527b6b9c94e75b7d5dbd48c9ef86c8cb2c4788d15ce7e63b55f237b20c","observation_id":"39aa3ebf-9a96-4592-bf18-bf2d18999fbe","resolution":{"observed_at":"2026-05-26T01:06:26.241267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with general value function approximation: Provably efficient approach via bounded eluder dimension","venue":null,"work_id":"98ca3e04-eb66-4c0f-ba87-e1d2b9ed9544","year":2020},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:c3210cf82ec12882e18545ae1d5b48dd568b0615de449bca399bd1c773f6d34e","observation_id":"637aad1f-b364-4135-b59e-25595319e3e7","resolution":{"observed_at":"2026-05-26T01:06:26.403109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"66091b96-af07-4e53-bdc5-e1c85c78997c","year":2020},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:99eb98e47783f6e9071137bb4aa27f27376f319eabd09c08fdc5289c6a3d633e","observation_id":"d696f753-80d6-421b-93f7-ac88e163b2e1","resolution":{"observed_at":"2026-05-26T01:06:26.248511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offline reinforcement learning with realizability and single-policy concentrability","venue":null,"work_id":"2c832f91-b462-429a-88e8-54be8e8ca80a","year":2022},"citing_paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-09T15:44:02.195783Z"},"links":{"citing_paper":"/paper/2605.05791"},"observation_digest":"sha256:b94a443cc2002e6c0ed7aa94858fc647cc3e882858517bee9f17f34782d20d4e","observation_id":"12d497a9-3b6f-4ef9-92dd-730aae09ecdd","resolution":{"observed_at":"2026-05-26T01:06:26.214289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05791","last_updated":"2026-05-07T07:26:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:26:58Z","title":"A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":58},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"thesis":"As of 31 July 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2605.05791."}