{"as_of":"2026-08-11T17:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:465ce276d66a622b1926677eaf877496f514daab74591a1a01552c966a7d5334","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:19:16.651877Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.02089/citation-record","integrity":"/paper/2501.02089/integrity","json":"/paper/2501.02089/citation-record.json","paper":"/paper/2501.02089"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.208948Z","title":"Im- proved algorithms for linear stochastic bandits","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.208948Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:1d40b6790570a82507ddb3cb7d8c885f48a6dcc7b721650eec4832c9738d01b6","observation_id":"8cd67070-287d-4075-be8a-2fa3de722aa9","resolution":{"observed_at":"2026-08-10T22:19:16.208948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.214445Z","title":"Model-based reinforcement learning with a generative model is minimax op- timal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.214445Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:2340d09c2b4bc1279d54f7d1aa885b7dbc2e5a983d0d98b427124effcf941ade","observation_id":"1529a580-e3fc-49a1-886e-e55ef4ae0448","resolution":{"observed_at":"2026-08-10T22:19:16.214445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.219509Z","title":"Degenerate nonlinear programming with a quadratic growth condition","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.219509Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:740c5d640e229c1d7f15032acebc548c26a12562dbb9594e7e5f33377c663456","observation_id":"d79c0843-8f33-40dc-b94f-c4a8d025be67","resolution":{"observed_at":"2026-08-10T22:19:16.219509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.225342Z","title":"Fitted q- iteration in continuous action-space mdps","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.225342Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c12f41c4033fa5e0ccf253af0df395ccb40562dd8d594f009db4c32c82f3b455","observation_id":"c4dce0c3-ce49-4107-bfd8-61e49fb6134b","resolution":{"observed_at":"2026-08-10T22:19:16.225342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.230182Z","title":"Learning the target network in function space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.230182Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:9eaa5520230788378ac9278824483e62c22cc626c760b3b9ae03992828c09a3b","observation_id":"1b85e5d2-4428-4f56-bda2-9ae3cc6a4408","resolution":{"observed_at":"2026-08-10T22:19:16.230182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.234126Z","title":"Finite-time analysis of the multiarmed bandit problem, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.234126Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ac7da8aa321f97dd311fab5eb6b89d2773e40dc51ba0055c36d5b2d120e5ced9","observation_id":"95f88b01-9202-49e2-ad3c-3b1126b78f35","resolution":{"observed_at":"2026-08-10T22:19:16.234126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.238833Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.238833Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:e36f951b9a6d4d0462981a321097eb0e94cebee53b34caa857c519d358f63da6","observation_id":"4bfac92d-a9d1-4350-9b10-538a891de260","resolution":{"observed_at":"2026-08-10T22:19:16.238833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.242675Z","title":"Prov- ably efficient q-learning with low switching cost","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.242675Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:a521a491f364ba87fceaea2de7c5fa620c3f6720afda166b4b70635c7134a4f4","observation_id":"612dbc69-42f1-4026-aac5-f9cb2c4542aa","resolution":{"observed_at":"2026-08-10T22:19:16.242675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.247682Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.247682Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:39b5f9208dc2baa07f25da119a6367ba036e3478fb8f24259ee325d14c5d9c22","observation_id":"391d16ad-2c33-4164-bce9-9a283ade1ad1","resolution":{"observed_at":"2026-08-10T22:19:16.247682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.252535Z","title":"Dynamic programming","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.252535Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:420702811212150c2fd9918987acd2215f1b0845e3b9e18b8574264b3fe4fdb0","observation_id":"6fed46ad-9f26-4721-a0fd-d6a4296b182e","resolution":{"observed_at":"2026-08-10T22:19:16.252535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.257046Z","title":"Online learning with switching costs and other adaptive adversaries","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.257046Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:5521260bf9072e53492c568ba4786c4899df4e76a315701a4e21a0359fda246d","observation_id":"2d5bcf53-36f9-43ae-95c6-59bda6936c10","resolution":{"observed_at":"2026-08-10T22:19:16.257046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.261458Z","title":"Information-theoretic considera- tions in batch reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.261458Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:80fd67fdf58ba263b2a59d76c449840bb61f48a7a0c5fcc3f658dda85d18fdf8","observation_id":"579c1e47-5e27-49f6-b5c0-15309c726438","resolution":{"observed_at":"2026-08-10T22:19:16.261458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.265753Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.265753Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:eb6c513b55599ad71ed41a565e0ffccd7397879b76c06726b9edd2763d8fb53c","observation_id":"6e30b8fe-222f-4a3d-8460-5f0773f20b1e","resolution":{"observed_at":"2026-08-10T22:19:16.265753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01380","last_updated":"2024-10-09T00:58:22Z","snapshot_observed_at":"2026-08-10T00:16:41.167347Z","submitted_at":"2023-10-02T17:42:01Z","title":"Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01380","snapshot_observed_at":"2026-08-10T22:19:16.269952Z","title":"Pes- simistic nonlinear least-squares value iteration for offline rein- forcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.269952Z"},"links":{"cited_paper":"/paper/2310.01380","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:bf67cdc23cefad857a4bcd8d8fc216d5f1a8e72743576e78ab0d4b013dc4f2b6","observation_id":"b77f5264-9dea-4525-966d-53eb0a2c6bb8","resolution":{"observed_at":"2026-08-10T22:19:16.269952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.274588Z","title":"Minimax-optimal off- policy evaluation with linear function approximation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.274588Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:d119b32653b4150fa1bf53e41213c4e74a9d8ddc5871d77c0ca9b6b6dd34df92","observation_id":"30728537-2956-4a7d-9cae-85becbeb2052","resolution":{"observed_at":"2026-08-10T22:19:16.274588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1103.4601","last_updated":"2011-05-06T02:38:18Z","snapshot_observed_at":"2026-08-10T15:57:17.735739Z","submitted_at":"2011-03-23T19:37:45Z","title":"Doubly Robust Policy Evaluation and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1103.4601","snapshot_observed_at":"2026-08-10T22:19:16.279147Z","title":"Dou- bly robust policy evaluation and learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.279147Z"},"links":{"cited_paper":"/paper/1103.4601","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7252f547812cbef47c1fb0f6ff8b3e4c4234e8e93a6015a7da9d3843d166130a","observation_id":"2f664f1a-61d3-4d8b-b260-dafc2f2b3c11","resolution":{"observed_at":"2026-08-10T22:19:16.279147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.284580Z","title":"Tree-based batch mode reinforcement learning","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.284580Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:68ea20be43166f0f0e7bc059084907bda909e148110466f9bb10feef8765841d","observation_id":"9ff4366c-7ce2-4045-b441-874bd0c7ad4b","resolution":{"observed_at":"2026-08-10T22:19:16.284580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.289795Z","title":"Discovering faster matrix multipli- cation algorithms with reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.289795Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:b3c8edf30b1024e7203b5522ae65a9ef3432863a09cffa2937d415ad5bdc5c8b","observation_id":"3e421dd0-e1f5-4858-aff6-0396b456a2f3","resolution":{"observed_at":"2026-08-10T22:19:16.289795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.294226Z","title":"Theory of statistical estimation","venue":null,"work_id":null,"year":1925},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.294226Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8f77e3c029e5c773f92055fb4b05e04576f51a3372c6f31b62889b1f58d6b4f2","observation_id":"1547a81a-a1db-4e9e-8690-9deba09ac06b","resolution":{"observed_at":"2026-08-10T22:19:16.294226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00494","last_updated":"2021-01-02T18:41:27Z","snapshot_observed_at":"2026-08-10T08:08:00.544438Z","submitted_at":"2021-01-02T18:41:27Z","title":"A Provably Efficient Algorithm for Linear Markov Decision Process with Low Switching Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00494","snapshot_observed_at":"2026-08-10T22:19:16.298033Z","title":"A prov- ably efficient algorithm for linear markov decision process with low switching cost","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.298033Z"},"links":{"cited_paper":"/paper/2101.00494","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ade86a427d563f3fd1c963c6a8dd0d9ba53a599706692adf9b9473e90f9ce023","observation_id":"b23adf15-01b8-408c-ba93-c0a3705e9685","resolution":{"observed_at":"2026-08-10T22:19:16.298033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.302003Z","title":"Batched multi-armed bandits problem","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.302003Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:fa84eb28bcec2606f1f425200792f4c46949d7253c5f8f1e54e059f973a56226","observation_id":"6db73a91-af48-4e56-80e4-676867e272e1","resolution":{"observed_at":"2026-08-10T22:19:16.302003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.305987Z","title":"Off-policy deep rein- forcement learning by bootstrapping the covariate shift","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.305987Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:74e82cf2086e615d54ad1f5f84f3fb685466ceb7009180c7983b10abbb8cd3bb","observation_id":"cac3d414-6306-424a-b5bb-2427cbdfb052","resolution":{"observed_at":"2026-08-10T22:19:16.305987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.311486Z","title":"Minimax pac bounds on the sample complexity of rein- forcement learning with a generative model","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.311486Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:55f0fbb4a84e6dba0b01b5091a46043f706b2e8bea4426ea039564ccf5c5560d","observation_id":"961f3efe-270f-40b7-9217-70dd5c1cf63b","resolution":{"observed_at":"2026-08-10T22:19:16.311486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.317103Z","title":"Maxmin expected utility with non-unique prior","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.317103Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:5268a5604ad42b16e9d6d6631b60a32e3b44ff6cf5300c23a2db42a5713663f8","observation_id":"689b4757-97cd-4604-b07c-f3f151f94402","resolution":{"observed_at":"2026-08-10T22:19:16.317103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.321994Z","title":"Approximate solutions to Markov decision processes","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.321994Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:bfffbcabf6d6f685183cb2d5f3278fc074e35487fc7671128946b698f4b04f04","observation_id":"1b6a0a7d-db16-4d7a-98c6-b9ab21630074","resolution":{"observed_at":"2026-08-10T22:19:16.321994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.326694Z","title":"Networkgym: Reinforcement learn- ing environments for multi-access traffic management in net- work simulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.326694Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c9bb11925b460511ff3db3d8c9f816da9ce1745a29e2e65d57e85829d508088d","observation_id":"2fe80bfc-4112-4f5f-b37b-55194084191d","resolution":{"observed_at":"2026-08-10T22:19:16.326694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.331632Z","title":"Consistent on-line off-policy evaluation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.331632Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:e3f716372338c12b88c6b85d23174a190d12b896f54f62a92bd84774530af882","observation_id":"60ca303f-2507-4a8c-a827-34d6d588f2ca","resolution":{"observed_at":"2026-08-10T22:19:16.331632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.336214Z","title":"Bootstrapping fitted q-evaluation for off- policy inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.336214Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:783b6725d11f5c5d162d60144f02ee343075c919a6ca328d63a061e8d4728548","observation_id":"05eb0f54-0dd3-451b-b852-3dffe9027cc4","resolution":{"observed_at":"2026-08-10T22:19:16.336214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.340340Z","title":"Effi- cient estimation of average treatment effects using the estimated propensity score","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.340340Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ba8639e59fbbac7f95943deaf365584c96cd1b8a77a209d7fc8a82d524a480b3","observation_id":"667d8a66-1ef5-4361-8463-37b978db587a","resolution":{"observed_at":"2026-08-10T22:19:16.340340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.344523Z","title":"A generalization of sampling without replacement from a finite universe","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.344523Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:d91ae6d38f8f21ea1720de759814ae4267c87d2da61176144892b60ab8cad0c2","observation_id":"d26e45f8-545a-4681-901f-2b34b8f84dab","resolution":{"observed_at":"2026-08-10T22:19:16.344523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.348936Z","title":"Towards deployment-efficient reinforcement learning: Lower bound and optimality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.348936Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:9b314e75548c2c1e25803fabfebb2dbd2232bccdb1dfd1381bf8ec772ab04fbd","observation_id":"f0b9d2f9-6be9-4d6c-b1c6-7370f8df9449","resolution":{"observed_at":"2026-08-10T22:19:16.348936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.353131Z","title":"Aleatoric and epis- temic uncertainty in machine learning: An introduction to con- cepts and methods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.353131Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:35834ec6ec056c9df7d338fb7af8852a04c1797488b892e5127b8600a0aba83d","observation_id":"043356c3-92bf-4056-b959-a07c8de46a47","resolution":{"observed_at":"2026-08-10T22:19:16.353131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.784537Z","title":"Doubly robust off-policy value eval- uation for reinforcement learning","venue":null,"work_id":"bddf9afc-5f95-4961-8fd9-e570ac7ba82a","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.357051Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:2762da9f3647a22670602410fd4b563eab3d1acb573dff9941d72a6985fb57ca","observation_id":"4c4b3a65-6f0c-404d-aa1f-1ff225bc51bd","resolution":{"observed_at":"2026-08-10T22:19:17.788348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.770890Z","title":"Offline reinforcement learning in large state spaces: Algorithms and guarantees","venue":null,"work_id":"ef5c8846-f33d-48ed-9628-c03765ac825b","year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.360774Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:5c946716dd7966917069f44e3da378c1473c1416decb5099cf68a085c1e16781","observation_id":"e6085e59-902e-41c4-91d9-e09f3fc8ff07","resolution":{"observed_at":"2026-08-10T22:19:17.775309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.757670Z","title":"Is pessimism provably efficient for offline rl? In International Conference on Machine Learning, pages 5084–5096","venue":null,"work_id":"eec0be75-1b51-49b7-b6c7-47f965855e42","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.365059Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:3fc0eb8c5e8deac6f97f5624a9262444f3cd5932426d3adbfd29f45e93fcbec7","observation_id":"f52c8254-9bed-41b8-9dff-eb535d10df04","resolution":{"observed_at":"2026-08-10T22:19:17.761998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.744376Z","title":"Double reinforcement learning for efficient off-policy evaluation in markov decision processes","venue":null,"work_id":"0eea0a64-7407-4733-8f12-cf0621bcbca4","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.369711Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:5d43daf8563925a9380c52e73c844afe58618a8030ceb2f48cd50b71aa3ad708","observation_id":"b8a3ab84-a748-4bcd-b827-85ff45cac308","resolution":{"observed_at":"2026-08-10T22:19:17.748834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.730633Z","title":"Efficiently breaking the curse of horizon in off-policy evaluation with double reinforce- ment learning","venue":null,"work_id":"a0520a72-1650-42eb-ae00-b0cc108cd935","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.373992Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8cc591c845dfbe11a7f9dc19c87a4288e9b180808c52c0d53573b5527ec3cd57","observation_id":"5a83a642-146b-4251-9a99-64b8b41d7be2","resolution":{"observed_at":"2026-08-10T22:19:17.735715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.718353Z","title":"Near-optimal reinforce- ment learning in polynomial time","venue":null,"work_id":"96e5640b-43fc-4755-bfcb-d395b0a635e5","year":2002},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.378249Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:30bc93dd3b4cb3547479b66f901a52b79f9a605277ea33a9009bf62d0e7a3bd3","observation_id":"bafe5139-e632-4f6d-8cb9-5edc5238010c","resolution":{"observed_at":"2026-08-10T22:19:17.722332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.706176Z","title":"Introduction to empirical processes and semiparametric inference, volume 61","venue":null,"work_id":"9a209f0f-456b-4226-a572-78a16c6c33e6","year":2008},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.383340Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c752b6edbcbfa3c563fa4178734346730eaecaa5679c0b93048496f32a5fc509","observation_id":"6226483e-26dc-4d44-9f62-557c512b6647","resolution":{"observed_at":"2026-08-10T22:19:17.710137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.693740Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":"96350c9a-6f92-43b9-883c-4f149967167a","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.387687Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:3b93e43a4f246ce9f00bb9890a1b19c8f82e381d19df0bd87d6c144a672cbc25","observation_id":"8641d3d2-57e5-4f99-8e8a-5d4477510b90","resolution":{"observed_at":"2026-08-10T22:19:17.698074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.680445Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"713d4b4b-1d03-4de6-b1b9-488858e7a655","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.391784Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:0873a6e518a94305cfe70ae7563c54ad02925945c96acf14adaa3f9024c3d14e","observation_id":"0663e18c-acf2-4cba-9ed9-b16a229433a0","resolution":{"observed_at":"2026-08-10T22:19:17.685186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.667242Z","title":"Minimax theory","venue":null,"work_id":"ebb305bd-4cd0-4ced-912c-fc8952ed2263","year":2008},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.395913Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:1d959021aa9f8106b1636efa320fb22f85004d04fc7dc531a956a45b277b6849","observation_id":"3aa17862-1c9b-4384-92c8-b34eecdbfe0a","resolution":{"observed_at":"2026-08-10T22:19:17.671509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.654069Z","title":"Batch policy learning under constraints","venue":null,"work_id":"6d0cba9a-6556-4ee8-ba95-210353c6c68c","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.400745Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:962e9972a0b78b7b8c8f7073c8365fef1b193b9f866eca47ebf06d4c47e12019","observation_id":"9a2ba5fa-fec8-4916-8dc0-a6bd09c3fd44","resolution":{"observed_at":"2026-08-10T22:19:17.658549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-10T22:19:16.405537Z","title":"Offline reinforcement learning: Tutorial, review, and perspec- tives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.405537Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:96c4795f12f740e504b900dfe3e3b80dd0c3e52920353c5cdf5807877670401a","observation_id":"53fbf41f-b39e-4273-baa9-63ed9b715275","resolution":{"observed_at":"2026-08-10T22:19:16.405537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.641448Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model","venue":null,"work_id":"90abe7eb-faec-406c-954f-f634a9c98f8d","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.410690Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:1d5dab53aadcef4164dbfafeb2102975d26a5b49549b5e9ec8339f85df14e3dd","observation_id":"215ce0da-c7fa-4b64-8547-77caf4e57389","resolution":{"observed_at":"2026-08-10T22:19:17.645299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.628872Z","title":"Offline reinforcement learning with closed-form policy improvement operators","venue":null,"work_id":"11770b21-3f3b-42d3-b2be-6246e2c9d7f4","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.415116Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c01b9a88e3747850c78dea9d73e8ef48bdbee598cda5837e6d5c96b76a6ff078","observation_id":"49255547-06f2-4497-9765-454caa65547e","resolution":{"observed_at":"2026-08-10T22:19:17.632786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.616736Z","title":"Unbi- ased offline evaluation of contextual-bandit-based news article recommendation algorithms","venue":null,"work_id":"f2a03efd-451d-4ebd-bfde-878a9925dcc9","year":2011},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.419615Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f2690ad894b1f4b58e9249f3b827b2b25e52bb89e4706943d1948a2123f4675f","observation_id":"f09321f7-cc91-43c8-804d-e6d4873c4936","resolution":{"observed_at":"2026-08-10T22:19:17.620627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.603487Z","title":"Monte Carlo strategies in scientific computing, volume 10","venue":null,"work_id":"b925e4d3-a4a0-4038-aa12-83779e307585","year":2001},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.423566Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:97a6683fa6c957194ceff7113e7fbfe60d670f9c58490bb272a45cc1cebf34d8","observation_id":"9a16b704-7ff1-4654-80e9-82d0632306c6","resolution":{"observed_at":"2026-08-10T22:19:17.608305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.590659Z","title":"Breaking the curse of horizon: Infinite-horizon off-policy es- timation","venue":null,"work_id":"b55b8c95-197f-48bd-b4ca-ce3ae54a8a87","year":2018},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.427799Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:221c3eca9fa550591545c6898836e33a88257a55f6d519a850d64ee2b0af112b","observation_id":"78954958-2c3a-4b48-8a42-23141e5ff526","resolution":{"observed_at":"2026-08-10T22:19:17.595029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.576718Z","title":"Off-policy policy gradient with stationary distribution cor- rection","venue":null,"work_id":"fa8a8dcd-1411-4f46-96a5-f6c894b076a8","year":null},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.432172Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:69baf571a6e83210d7cdcda2de8f3278bbe5ed46a8c6af0897b14634e0deee9f","observation_id":"57a75e49-66aa-434d-9959-297a5db9a7af","resolution":{"observed_at":"2026-08-10T22:19:17.581997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.563307Z","title":"Provably good batch off-policy reinforcement learning without great exploration","venue":null,"work_id":"789069c1-7847-4f24-94ec-4cd0211faa23","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.436590Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:18b79172ac39cef613a028ce478299cf12c01ce33d9c4d8d21d9fafac7fd3df2","observation_id":"ae97e546-50b3-4c9b-bf78-01671a0aa7ee","resolution":{"observed_at":"2026-08-10T22:19:17.567624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.550297Z","title":"Mildly conservative q-learning for offline reinforcement learning","venue":null,"work_id":"dec37a8c-3496-48d2-baf0-989fc6bbd890","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.441947Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:99da91715b9f0994764d99c0a6549183cd16b6ad59995655f5f06dbda0358839","observation_id":"405675f4-ba25-4549-8375-532ad9945af0","resolution":{"observed_at":"2026-08-10T22:19:17.554612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.538083Z","title":"the distribution-norm to the res- cue","venue":null,"work_id":"1316caac-55f9-4ddf-a520-febd526c2296","year":2014},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.446115Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:41eb337295315d90bd4ac05dffa8c1604135ca2e81a14acdb8c515e36363213a","observation_id":"9e7b0ac0-cd9f-41d8-acd5-3af09958e87e","resolution":{"observed_at":"2026-08-10T22:19:17.541828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.525240Z","title":"Faster sorting algorithms discovered using deep reinforcement learn- ing","venue":null,"work_id":"01cff58b-e563-4a97-89a2-27a4ebf77e5b","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.450397Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f0a1f631933a03ce4a997658cc75ea66b91a51284eebdafa003c8498b4f20877","observation_id":"54ed687c-d2c2-46b3-a236-996f74795263","resolution":{"observed_at":"2026-08-10T22:19:17.529395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.511836Z","title":"Neural adaptive video streaming with pensieve","venue":null,"work_id":"37118f5b-6d0d-44d7-a0bd-45a32bcb5814","year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.455122Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ea3d262d65f95400c95afe5cb33b253446b6f3334247ba1a533b9765abe6a0ca","observation_id":"1e0d4ece-f616-4e4f-81d8-bdb7858b2412","resolution":{"observed_at":"2026-08-10T22:19:17.516072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.496180Z","title":"Deployment-efficient reinforce- ment learning via model-based offline optimization","venue":null,"work_id":"57820859-d589-4b17-9f3a-6e0def97ea7d","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.459496Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:38452deb41e1ef50304aa281be2a15214ba4e8be15b88b4b70b16c4a7cda70e4","observation_id":"8b2e305d-de76-487c-835f-3755f4a0be3a","resolution":{"observed_at":"2026-08-10T22:19:17.502046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.483513Z","title":"Dependent central limit theorems and in- variance principles","venue":null,"work_id":"e48a203b-b785-4d2b-bc83-64f764a5776d","year":1974},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.464018Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:dcf568dd69f952de9bf1a1e88e4b874c8133912a7ed0c9bf0be853ca6f30ffa6","observation_id":"cb40f6e4-1f27-4e42-bff5-f758f1b319b9","resolution":{"observed_at":"2026-08-10T22:19:17.487751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.471792Z","title":"Variance-aware off-policy evaluation with linear function ap- proximation","venue":null,"work_id":"7b8ca078-62e7-4733-bd39-444d24430f4c","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.468042Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c25cdce04d912ffc3f289bed989f00857c95a2c2446838413ed61dc2a6820490","observation_id":"58ccbf41-73d4-412d-89f5-14b877a01c8b","resolution":{"observed_at":"2026-08-10T22:19:17.475680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.459016Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"384215ea-1a43-437b-a641-60ed625ffdec","year":2015},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.471469Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:bec59f9f81019fb1d6e84f9adaceb05e26784bc276aa1a67613c6daa90be70c1","observation_id":"e34d18aa-ef27-4d2a-9fb0-74054f8e5149","resolution":{"observed_at":"2026-08-10T22:19:17.462963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.446611Z","title":"Bootstrapping: A nonparametric approach to statistical infer- ence","venue":null,"work_id":"a5308012-ead4-4758-b244-c1ced051bb06","year":1993},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.475970Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:4eba8d56f3aba4d309d985a5b2772f7daa1134b51825f4a283a6831afd29fb6f","observation_id":"dd6bb0c5-0cfa-427b-b9ca-0fed1a73afff","resolution":{"observed_at":"2026-08-10T22:19:17.450599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.432888Z","title":"Finite-time bounds for fit- ted value iteration","venue":null,"work_id":"696f3c43-fc0a-4814-b2cd-fa9241ee0a0c","year":2008},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.479912Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:98c6d56674c53693682f0065880f874978749b52d63a31a2529fde3668f025ca","observation_id":"e59f5fa6-37ca-4640-8f65-b706af237290","resolution":{"observed_at":"2026-08-10T22:19:17.437575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.417821Z","title":"Marginal mean models for dynamic regimes","venue":null,"work_id":"3bcb76ee-b246-423b-9d9e-d8fdedacb38a","year":2001},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.483698Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:12e599a1fc6f1503ddf9760c730286adf58aa21d307c4980eb982c6ac94664d9","observation_id":"193c6ec1-b31e-4457-95f6-cac07abce26a","resolution":{"observed_at":"2026-08-10T22:19:17.422478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.403867Z","title":"Dualdice: Behavior-agnostic estimation of discounted stationary distribu- tion corrections","venue":null,"work_id":"c5ff9a6a-6de1-4ed6-bd55-9b4d9e583f5e","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.487956Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:6822be4336a23c9c099cdaef29a556c751ffb10238201ff59bba65ad45241fb3","observation_id":"3ccf2f67-d769-44e9-9bce-ee8a2068faaf","resolution":{"observed_at":"2026-08-10T22:19:17.409007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-10T22:19:16.491915Z","title":"Algaedice: Policy gradient from ar- bitrary experience","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.491915Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:dbd2101252adf55b17b7578302fe53f40b179d68f771a137adf703b4248e241f","observation_id":"95de1a03-1199-4c28-ad5b-2985258fee37","resolution":{"observed_at":"2026-08-10T22:19:16.491915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.390539Z","title":"Optimal medication dosing from suboptimal clinical ex- amples: A deep reinforcement learning approach","venue":null,"work_id":"437ae357-5435-4be5-a1cd-062c14a98713","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.497573Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:612c4716ea640656ff12cef4236307ebbcfec2749fcea55b0651194ce6ba6880","observation_id":"b0d4c04b-e228-4175-ae87-a8383b436721","resolution":{"observed_at":"2026-08-10T22:19:17.394785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.376319Z","title":"On sample-efficient of- fline reinforcement learning: Data diversity, posterior sampling and beyond","venue":null,"work_id":"cf62ec6e-d188-4051-9889-09ce0c22b801","year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.502392Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:2696d1b83951f3ca2abd3999fc525135a5862806e45134c6a48ce94aca986394","observation_id":"c3585e0a-0abb-469f-9e0b-71f14dfd013e","resolution":{"observed_at":"2026-08-10T22:19:17.381978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.363816Z","title":"On instance-dependent bounds for offline reinforcement learning with linear function approximation","venue":null,"work_id":"099489a6-4fe2-4c8d-be81-fcf05f047f6e","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.507044Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:0c0c095311e973c86c396ba043b8ae8e46862cf77c5122c94df1a2693dab6d58","observation_id":"19b323a4-cbe9-4848-895f-91a27aa5631a","resolution":{"observed_at":"2026-08-10T22:19:17.368016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.350391Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":"0ab240bd-71ab-49a2-bb42-a320423990d1","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.511379Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:5f192506bf4ba00752ed569147f4093e1621b0c9c03290af7fd12a4248784834","observation_id":"2d4b2c17-a3f3-47bd-bd3d-27744fb6f1b5","resolution":{"observed_at":"2026-08-10T22:19:17.354576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.337134Z","title":"Batched bandit problems","venue":null,"work_id":"1f81e213-4213-49ea-a65d-53c4f678128d","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.516827Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:b516fb8a29018a4d500d9b4d03485b8e6aeb9ad436b9b0903f71a0dd04641d5c","observation_id":"2e04c9c0-c068-49f1-81b0-e36439b6e035","resolution":{"observed_at":"2026-08-10T22:19:17.341189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.321739Z","title":"Approximate Dynamic Programming: Solv- ing the curses of dimensionality , volume 703","venue":null,"work_id":"a7326743-88a9-420a-8c8a-f463c8ed144c","year":2007},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.521801Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:021d9e8d9a49439d3bb43438d092ea7a7b212778105d9d02361a19dc6ac569ec","observation_id":"4c44f74f-5eb9-4085-b8d9-9d5dd9f2e6d4","resolution":{"observed_at":"2026-08-10T22:19:17.326945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.307242Z","title":"Eligibility traces for off-policy policy evalua- tion","venue":null,"work_id":"20b7efe8-a0f6-4705-b616-6fca67c09466","year":2000},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.525885Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:201436c2e903865be440a15b73350d49f5e8e759b25a45d8a428d3eb04adcc2a","observation_id":"e5b586e5-8f70-4316-b061-bf6d2bf8990a","resolution":{"observed_at":"2026-08-10T22:19:17.311762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.294260Z","title":"Markov decision processes","venue":null,"work_id":"5e8f2174-a7dd-4906-9e48-d883ec562bde","year":1990},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.529327Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:3ed4ccbc9d92ec7348bd2c2140937c2dc781d385f7a0ad9939e3f069c3d5e28a","observation_id":"45d70d9d-3624-4ccc-8f27-5dd679f15df5","resolution":{"observed_at":"2026-08-10T22:19:17.298253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.280794Z","title":"Near-optimal deployment effi- ciency in reward-free reinforcement learning with linear func- tion approximation","venue":null,"work_id":"f7926e02-9940-4e52-b151-58525c6dd88c","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.533749Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7326a4fd6c3b29e43142926c61a5f98728d22200c298421231f21f0c44248748","observation_id":"563ed0ae-d2b1-41ed-91ff-088985f8c4ae","resolution":{"observed_at":"2026-08-10T22:19:17.285372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.265503Z","title":"Sample- efficient reinforcement learning with loglog (t) switching cost","venue":null,"work_id":"ea35ae2b-ac5c-4b95-94f5-9434a1142655","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.539089Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:540bae17c2083042e1d68ff4c7208d9528fdc688eb8286c864d8d2d202623f08","observation_id":"5cc730c1-b9ae-4717-bff6-d5aed1d48b13","resolution":{"observed_at":"2026-08-10T22:19:17.270273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.251119Z","title":"Logarithmic switch- ing cost in reinforcement learning beyond linear mdps","venue":null,"work_id":"d6b7f3df-b705-4cff-ae53-1600b5e25f57","year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.543674Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:64134d7bdf48a50c0d43308d73d832604ae4bcf74dccf7f962108f382d9f15e5","observation_id":"90471ee9-5843-4fbd-be07-5c0ef964fc56","resolution":{"observed_at":"2026-08-10T22:19:17.255721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.237886Z","title":"Bridging offline reinforcement learning and im- itation learning: A tale of pessimism","venue":null,"work_id":"ce6ddd13-69f6-4abc-89ac-bf102a973a41","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.548582Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:4ad93039bfdb7b0faba099875dba2408c35e696fd0515337800f2a2d85903350","observation_id":"d74fba3d-d6a5-40ca-bb2e-ac5dc47a8672","resolution":{"observed_at":"2026-08-10T22:19:17.242121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.224479Z","title":"Nearly horizon-free offline reinforcement learning","venue":null,"work_id":"0ace4e46-f265-4f54-8c71-f5d8005ef688","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.553237Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:be13bfb1237146e40bd4175a3963b3942871a2555a6e2fb5b1843a440cd1ae67","observation_id":"08b9b6dd-f4fb-4a25-bcee-9eba6b35c3e6","resolution":{"observed_at":"2026-08-10T22:19:17.228950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.210631Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":"8854c223-69b7-4a0e-b1ca-f9ded3149256","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.558147Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:378a47284c06028d51f9fe0a9c98dd9870780c8c622b215181032bb38d3fb5ce","observation_id":"73f5d59e-d8e3-46ff-8735-08a530c69867","resolution":{"observed_at":"2026-08-10T22:19:17.215211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.563181Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.563181Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:45f71079342ef618d60d119467ca173c679d92ddb7d14fa05c4a73ef5418f203","observation_id":"60a06f68-e025-467a-9587-758852db3281","resolution":{"observed_at":"2026-08-10T22:19:16.563181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.187959Z","title":"Learning to summarize with human feed- back","venue":null,"work_id":"bf11327a-51c7-4c02-92db-22aa6bc7cb44","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.567487Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:87af9800fae7b640b2dd3d9a6ae1c89b5563b738c4b065f21a045cc872ed5668","observation_id":"aa648aef-6fb2-4b3c-9e69-3af10e8a56ca","resolution":{"observed_at":"2026-08-10T22:19:17.192685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.175027Z","title":"Reinforcement learn- ing: An introduction","venue":null,"work_id":"6d167947-107c-4e5d-b65d-288bfeb5714e","year":2018},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.571125Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:89559ae53faa6f0aa4e162204b154cee94c836b8164db0393ec40cbc4d0a08c5","observation_id":"d0e89996-56c5-4de9-b783-0482330b2bde","resolution":{"observed_at":"2026-08-10T22:19:17.179346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.162026Z","title":"Finite time bounds for sampling based fitted value iteration","venue":null,"work_id":"bd65e416-2861-45ff-b9b6-1a69cac6e6d3","year":2005},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.574853Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7ab96bbba65b82eb72d2310b75b1b9a5f278a935955cc26fb4a826aba4406e22","observation_id":"5c4d9419-5927-4a22-adc4-ac8db1fc9fd2","resolution":{"observed_at":"2026-08-10T22:19:17.166147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.578347Z","title":"Semiparametric theory and missing data, volume 4","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.578347Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:10283703d53ffa9dcd130ddac200e49dc2509867c81b1063d594916f14864e57","observation_id":"1f620bd3-35e8-4b44-a8e0-c92594300be9","resolution":{"observed_at":"2026-08-10T22:19:16.578347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.139016Z","title":"Minimax weight and q-function learning for off-policy evaluation","venue":null,"work_id":"b0a26386-776e-4636-9e08-738d194d1c32","year":null},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.584284Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7d6503416efbc97f16400b90a3198a7abc2da813a646481c45f7840133848a41","observation_id":"5253eba6-d85a-49eb-a3e9-63f1629d1595","resolution":{"observed_at":"2026-08-10T22:19:17.143639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.125153Z","title":"Asymptotic statistics, volume 3","venue":null,"work_id":"c9e54b47-463e-43ae-a6f8-8ae677e38a97","year":2000},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.588943Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:e9a90ce8f0933ee099e10f0ee9f4709f8e5a65c648f5bbd45edb15401ca3465a","observation_id":"fdef9586-60e1-47ab-aaa9-a545b885a559","resolution":{"observed_at":"2026-08-10T22:19:17.129716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.111706Z","title":"High-dimensional statistics: A non- asymptotic viewpoint, volume 48","venue":null,"work_id":"d2e59918-b0bf-43c3-9beb-19795e72bb2d","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.593223Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:84cc82c55cb4d31366a3a5f2fb614b0cdeaa5ff197c10e908bbf1e0e8e518cfc","observation_id":"f87c33c9-fd40-4ca5-8ba6-c586cc08db69","resolution":{"observed_at":"2026-08-10T22:19:17.116170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.098005Z","title":"Provably efficient reinforcement learning with linear function approxi- mation under adaptivity constraints","venue":null,"work_id":"d31f0e8d-82f7-4f9d-a355-d2b3bcd37101","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.598331Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:cd92279186bfb2fd6f56074026abdae891f608631067a77b32248ecd4bf2d598","observation_id":"7b684ee2-762a-4cab-bb9b-37310552c199","resolution":{"observed_at":"2026-08-10T22:19:17.102768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.084882Z","title":"On gap-dependent bounds for offline reinforcement learning","venue":null,"work_id":"89eada30-6e63-4150-9aa0-df0d7c8f680c","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.602873Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:e4d6bca53dbcebe82229df46261c87b8ae098d5dfbe2c2f8c3b53352fe272337","observation_id":"d95b0957-9ce6-4423-818d-b7197348b8e4","resolution":{"observed_at":"2026-08-10T22:19:17.088796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.071453Z","title":"Opti- mal and adaptive off-policy evaluation in contextual bandits","venue":null,"work_id":"48eaadb2-df7c-452c-be96-0a4c23fd4a13","year":null},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.607201Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:64c3db6bb1ce9911b50e7f98f9b8b661312d712703caf380efe5f16473d5b29f","observation_id":"0646dc31-11d4-48ce-b901-1af3c63df95b","resolution":{"observed_at":"2026-08-10T22:19:17.075476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-10T22:19:16.611265Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.611265Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:31b5aa66aa1cd78d955282c65c8f32f57e6e69d9fa7bc47ed3d3a427d9878050","observation_id":"17268b18-fa42-4ba1-9a94-47bdce98e4c1","resolution":{"observed_at":"2026-08-10T22:19:16.611265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.057052Z","title":"On the optimality of batch policy optimization algorithms","venue":null,"work_id":"2a6879bd-8eca-4212-9179-c782d8ebf280","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.615198Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:219a04c594d806480a4487cd26450af518ce8cd09b91766c0db3da9d49f35a6c","observation_id":"4c6f5143-4834-4b7f-b907-f772f2121fc5","resolution":{"observed_at":"2026-08-10T22:19:17.061734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.043435Z","title":"Q* approximation schemes for batch reinforcement learning: A theoretical comparison","venue":null,"work_id":"f5e5299b-a29e-4287-8667-33bfbacb6d4b","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.619015Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:cee3b047c11bdd224378067dcfd33bc107858c8de7e6a0b9094ebe606029399f","observation_id":"9757f4e0-0dbe-4062-bba3-b3cfcc744b21","resolution":{"observed_at":"2026-08-10T22:19:17.047894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.029821Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginal- ized importance sampling","venue":null,"work_id":"717c7584-5f66-4bee-b98f-b0a0d80ac592","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.622611Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:1bcaf53ba8603481bbc1d44897a114a9aee6cb6fd7e2789a4c0c96814cfcbd24","observation_id":"189aff4c-fe89-4510-a5a7-af8d297a211c","resolution":{"observed_at":"2026-08-10T22:19:17.034006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.016641Z","title":"Bellman-consistent pessimism for offline rein- forcement learning","venue":null,"work_id":"ecfcb8fc-306a-4f69-a81b-1f163b77e819","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.626325Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8f8201460843567130ec1c3e4c750ddfa700605d21b2a6c047e847b6e1df535b","observation_id":"da2895fe-2f71-49aa-bfa3-6016f79f0d28","resolution":{"observed_at":"2026-08-10T22:19:17.020810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.630025Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.630025Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c431b8f9a36d8cb3c5dc9466d5e8d697f48d7ea03c96220968acd2902fc5ff13","observation_id":"19817067-7e7a-4a91-9f41-05d340030dd3","resolution":{"observed_at":"2026-08-10T22:19:16.630025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15512","last_updated":"2023-03-01T13:37:28Z","snapshot_observed_at":"2026-08-10T21:11:56.498944Z","submitted_at":"2022-05-31T02:50:17Z","title":"Nearly Minimax Optimal Offline Reinforcement Learning with Linear Function Approximation: Single-Agent MDP and Markov Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15512","snapshot_observed_at":"2026-08-10T22:19:16.633815Z","title":"Nearly minimax optimal offline rein- forcement learning with linear function approximation: Single- agent mdp and markov game.arXiv preprint arXiv:2205.15512, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.633815Z"},"links":{"cited_paper":"/paper/2205.15512","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c2494b1305c7e31947370046dab04c2ba24711f52132d35391691e48b3dfb46b","observation_id":"6064c2ed-6b28-489a-8a2b-74a6bfba6e3b","resolution":{"observed_at":"2026-08-10T22:19:16.633815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.993527Z","title":"Asymptotically efficient off- policy evaluation for tabular reinforcement learning","venue":null,"work_id":"be105f1e-e6f2-4c8e-9b33-7e991a8b7388","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.637934Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ed57fa5bac387db9d5f4f894bd6c1c3f9955ef41f96da8f4be1d8ea42f5d2273","observation_id":"6dfea6f6-3eb1-4951-bbdd-83da7727c7d5","resolution":{"observed_at":"2026-08-10T22:19:16.998146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.980434Z","title":"Towards instance-optimal of- fline reinforcement learning with pessimism","venue":null,"work_id":"b063f1f8-d1ca-45a7-8152-d4a6d4d74496","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.643262Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:73611ed8340864ee514ca92433bf096b1090d2453f88a7f1142f88232620aced","observation_id":"80472f83-d677-47e9-aeff-1e7a3590bdcf","resolution":{"observed_at":"2026-08-10T22:19:16.984804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.964969Z","title":"Near-optimal prov- able uniform convergence in offline policy evaluation for rein- forcement learning","venue":null,"work_id":"55abc23c-1468-45ea-9933-242c9632fe88","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.647430Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8dcb19632bbe75cd07bd3e0e5311f742a75bd7bcc11bbbe2900f4e9993d0f66f","observation_id":"cc4bef7c-c292-402e-8207-a764985f2dcf","resolution":{"observed_at":"2026-08-10T22:19:16.970026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.951724Z","title":"Near-optimal of- fline reinforcement learning via double variance reduction","venue":null,"work_id":"79c27aae-89e0-4b44-aa82-44ea658a8a19","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.651877Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:b65008a44fef996dea1af7e92120230ace79bf60438b2a43568387f544ad7792","observation_id":"5397d07a-78d9-4e51-baa1-2aa64fa26568","resolution":{"observed_at":"2026-08-10T22:19:16.955788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:12:17.645322Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":61},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 0 inbound Pith citation observations for arXiv:2501.02089."}