{"as_of":"2026-08-14T09:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0aad965dbf2513a0590945a4ec94a48e300a9d70e2989faccc764ae84b558db9","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:43:58.594829Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12786/citation-record","integrity":"/paper/2411.12786/integrity","json":"/paper/2411.12786/citation-record.json","paper":"/paper/2411.12786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.252471Z","title":"Eﬀective evaluation using logged bandit feedback from multiple loggers","venue":null,"work_id":"bb70ade3-c9c3-420d-85ae-22ec9af4a21f","year":2017},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.384377Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a61413288dfaa685102f08f2a0f4a6ce3f4eb226bd03c1f357af883aa9e42124","observation_id":"bdd83350-4a3f-4855-a636-79ceb0361447","resolution":{"observed_at":"2026-08-12T17:43:59.256076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.388449Z","title":"Thompson sampling for contextu al bandits with linear payoﬀs","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.388449Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b512d580ba95822fd7ca4cc6dd71e9e872cc7aad792c61d733a03259c2c789e9","observation_id":"13ea1470-4f55-4404-8e50-78c360375fc7","resolution":{"observed_at":"2026-08-12T17:43:58.388449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.237355Z","title":"Finite-sample optimal e stimation and inference on average treatment eﬀects under unconfoundedness","venue":null,"work_id":"2f8ad981-afd2-409b-8688-22f6b16ac133","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.391895Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:bf4afcdc45a4ac61c82c73a67d728941d1837e0dd1138fbc80486dd2c597ccb4","observation_id":"ce097e39-82ee-4281-b98d-a34f8d4f4eef","resolution":{"observed_at":"2026-08-12T17:43:59.240714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.227285Z","title":"Counter factual reasoning and learning systems: The example of computational advertising","venue":null,"work_id":"d23e989d-94cf-4298-b28e-5322ba2e2dfb","year":2013},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.395022Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:f0cdb6400fb4082a62c1b29997468efac7e16e2f3d76df06dada4b9e43de4748","observation_id":"8bf30fc0-a75e-412b-bc2b-87bb306bf313","resolution":{"observed_at":"2026-08-12T17:43:59.230750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.217916Z","title":"Double/debiased/neyman machine learning of treatment eﬀ ects","venue":null,"work_id":"8819fd17-bd90-41ab-9863-1e3d370e7430","year":2017},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.397978Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:5680e11dff5880c52cd7372184b135d0164156f555cd143e65428f729ab977e3","observation_id":"fd40c365-92ad-4ac5-bbc8-19596f448401","resolution":{"observed_at":"2026-08-12T17:43:59.221129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.208757Z","title":"Double/debiased machine learning for tre atment and structural parameters, 2018","venue":null,"work_id":"b4a5fd8b-0a2c-4f8c-9729-6fd9a5167146","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.401013Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:4de379166fcd54fc10099cbf7e94b7bf31af035409fdfe378da0e5625a5a0de7","observation_id":"e32cfe94-d42a-41ad-9186-b6f943c93bf2","resolution":{"observed_at":"2026-08-12T17:43:59.212056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.199462Z","title":"Semiparametric e ﬃcient inference in adaptive experiments","venue":null,"work_id":"43b0e378-ae96-45cf-b98b-08ee9cb9203a","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.404140Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b58dd6d2d7da8e9ec384b1c00b4c942f6ef7314bae5c0aebc52e39802bcc97ab","observation_id":"2e61cfd6-12a8-4a77-a4c6-12f39503cd48","resolution":{"observed_at":"2026-08-12T17:43:59.202829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.190476Z","title":"Clip-ogd: An experimental design for adaptive neyman allocation in sequential experiments","venue":null,"work_id":"4cb0e4f5-7265-423d-80c8-be9a31cda277","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.406886Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:2aca857cbbae49af438b7aba2160601a2c879c2f60eb89e33d68c8706d545c4d","observation_id":"491d4f36-c436-434a-a1b3-0c90b1b30727","resolution":{"observed_at":"2026-08-12T17:43:59.193720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.180957Z","title":"Do ubly Robust Policy Evaluation and Optimization","venue":null,"work_id":"5a2019b0-b364-452c-84aa-48bd5a436231","year":2014},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.409474Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:e86dcd04b8e07538dac75867b8b22361263ee1f3e8a19a29e724a5201db9d860","observation_id":"dfdd3bd8-5e89-4030-b644-7e841cfa0b74","resolution":{"observed_at":"2026-08-12T17:43:59.184495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1103.4601","last_updated":"2011-05-06T02:38:18Z","snapshot_observed_at":"2026-08-10T15:57:17.735739Z","submitted_at":"2011-03-23T19:37:45Z","title":"Doubly Robust Policy Evaluation and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1103.4601","snapshot_observed_at":"2026-08-12T17:43:58.412086Z","title":"Doubly robust po licy evaluation and learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.412086Z"},"links":{"cited_paper":"/paper/1103.4601","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ff5660e72d45c1e7739966cb68995c1b82a21b07058f7d6098a06c62c775c680","observation_id":"dff7eb14-9d79-402b-ad90-bf38a1f04644","resolution":{"observed_at":"2026-08-12T17:43:58.412086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.172561Z","title":"Overlap in observational studies with high-dimensional covariates","venue":null,"work_id":"786e666d-6b57-432d-aa2d-b8bcff78999f","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.415711Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:1776cfebf62da6b11357bc944d56c49caf2c113eec40523fff74e44d973e982a","observation_id":"7d9430af-0516-438e-bd0d-a37e3f968b60","resolution":{"observed_at":"2026-08-12T17:43:59.175673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.163852Z","title":"More robust doubly robust oﬀ- policy evaluation","venue":null,"work_id":"a256ff60-6b3b-4685-bad2-3a1e3329fd6e","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.419407Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a3fb3270543882df46128887311f6e9dcdecad95e9669c5ed88844d93adec3dd","observation_id":"2b0c36a5-6efe-4731-b99e-726bed0c03d4","resolution":{"observed_at":"2026-08-12T17:43:59.166818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.154217Z","title":"Oﬀ-policy evalua- tion with deﬁcient support using side information","venue":null,"work_id":"02668f05-2dda-430f-8886-d0a6722a1dc7","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.422621Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:e5e7a3b74f5bd18efbbbb7d338c210db54b09ed09b782a4ad76a1f120577b9af","observation_id":"a62be84f-d5b7-47bf-ae67-fe25208a1530","resolution":{"observed_at":"2026-08-12T17:43:59.157620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.145036Z","title":"On choosing and bounding pr obability metrics","venue":null,"work_id":"5977551d-6571-4838-b6ed-d43a5ec6ba41","year":2002},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.425943Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:76abd51b9b7af1fb257574d21d4488eda752f4a87648cc867429f41f81fd21e1","observation_id":"42f631f7-b5c5-4b08-ba6e-5e56dd33b700","resolution":{"observed_at":"2026-08-12T17:43:59.148297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.135615Z","title":"Some limit theorems for empirical pro cesses","venue":null,"work_id":"892cf651-5d05-4408-a6ee-cf9ee087f395","year":1984},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.429094Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:bf996083bb2519da47ea249d0892e6d610724df38a9efad11b2bd9ca7c30ce58","observation_id":"4efef9cc-4459-402c-82b4-b956e067a7e3","resolution":{"observed_at":"2026-08-12T17:43:59.138932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02768","last_updated":"2021-02-12T20:03:50Z","snapshot_observed_at":"2026-08-11T14:33:21.579861Z","submitted_at":"2019-11-07T06:15:52Z","title":"Confidence Intervals for Policy Evaluation in Adaptive Experiments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02768","snapshot_observed_at":"2026-08-12T17:43:58.432460Z","title":"Conﬁdence intervals for policy evaluation in adaptive experiments.” arxiv e-prints","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.432460Z"},"links":{"cited_paper":"/paper/1911.02768","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a324119f53268e3765c3fbd7afd5278221fa242b8269d5b6741eb3c6f7489cd8","observation_id":"41617ce4-8cec-4cd5-a09a-1744a5b61858","resolution":{"observed_at":"2026-08-12T17:43:58.432460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.125395Z","title":"Conﬁdence inter- vals for policy evaluation in adaptive experiments","venue":null,"work_id":"733361b0-b873-45a6-99db-2a0f1231c794","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.436031Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b76b534724f46a47eac75a1a4daf82a16e3bfa4495edcfac6917205fc6b62803","observation_id":"0766f0a5-fa30-4f30-a69c-f9b62ed2d9d7","resolution":{"observed_at":"2026-08-12T17:43:59.129076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.115839Z","title":"Introduction to online convex optimization","venue":null,"work_id":"8047406d-ff48-4eed-ab58-89597cb43568","year":2016},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.439220Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:0ede09dbe5bfb1e99328c72fcd4236ef35661c063d80be8b0ce6c3a907bedf5f","observation_id":"692f9d41-76df-4b6a-a04a-de2cafda0a08","resolution":{"observed_at":"2026-08-12T17:43:59.119387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.106209Z","title":"Weighted average importance sampling and def ensive mixture distributions","venue":null,"work_id":"65fe94f3-0e09-4c50-9872-8fd646c1d4f8","year":1995},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.442438Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:eeca2d69ce3d85a3001df03f534f813c7ec5a31c65bbbb1a698bbb46057d3dac","observation_id":"51e107c3-03f6-491f-bbdb-60360cedec4b","resolution":{"observed_at":"2026-08-12T17:43:59.109820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.097142Z","title":"Eﬃcient estim ation of average treatment eﬀects using the estimated propensity score","venue":null,"work_id":"fa1df206-6ce5-4b18-9dda-a4ce41d5df3c","year":2003},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.445622Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:6962cdc8dd797354fcad7949e6a3ca2616195d017efd31ec97b2ce812be16940","observation_id":"fddd75ce-9f02-4eaa-b5f8-1d1e2d9534fe","resolution":{"observed_at":"2026-08-12T17:43:59.100505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.087737Z","title":"A generalization of sa mpling without replacement from a ﬁnite universe","venue":null,"work_id":"face0fdf-495e-4bb2-a7fe-40b465d2f7ca","year":1952},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.448907Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:176a8caee2aae46e881d0101e4cd3cf8c3fc34ace87cf73e7472a6770185c07a","observation_id":"ff2cfef6-8ffe-4454-9e4f-cef40093e66d","resolution":{"observed_at":"2026-08-12T17:43:59.091187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.077460Z","title":"Howard, Aaditya Ramdas, Jon McAuliﬀe, and Jasjeet Sekhon","venue":null,"work_id":"63c6d814-6837-47af-a253-c1e20a6e4d9b","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.452186Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:500b5f6a2d178a831962d0b3a94016fa76b4b9d37ec242af6371aa3a932eca66","observation_id":"765d4f6a-cc66-4f1b-98c3-af5a1bfbf90c","resolution":{"observed_at":"2026-08-12T17:43:59.080484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.068384Z","title":"Nonparametric estimation of average treatme nt eﬀects under exogeneity: A review","venue":null,"work_id":"9b0fcf38-1ddd-406d-8ad9-12d2f11ac07b","year":2004},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.455371Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:58f1e891d40805885e7bf4cbe656c55bad64ee74ebeb3cb6a500106da9f99dff","observation_id":"42d8ad55-67c2-44d3-b7e5-37b9018e7402","resolution":{"observed_at":"2026-08-12T17:43:59.071509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.059669Z","title":"Causal inference in statistics, social, and biomedical sci ences","venue":null,"work_id":"80ab9f08-c3ad-4ee4-b9bf-aecb63a77965","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.458429Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c1c35a2bda6696ef177e7a0c08b092a577fdab8612167bf57c0fa3e1640ee144","observation_id":"ab7db0ae-314d-4100-bf24-ca9e988eb639","resolution":{"observed_at":"2026-08-12T17:43:59.062808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.050659Z","title":"Truncated importance sampling","venue":null,"work_id":"0511d83d-c634-416c-8fab-b04d414de587","year":2008},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.461628Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:6a4536abe8a347ea82e347cb893b6af816fd5fac4e6ceb3529b6737a867fdc7b","observation_id":"54c95186-535e-4c35-b68f-a97bb9c66e74","resolution":{"observed_at":"2026-08-12T17:43:59.053695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09900","last_updated":"2025-06-05T01:50:31Z","snapshot_observed_at":"2026-08-13T13:18:35.409457Z","submitted_at":"2022-12-19T22:43:08Z","title":"Policy learning \"without\" overlap: Pessimism and generalized empirical Bernstein's inequality","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09900","snapshot_observed_at":"2026-08-12T17:43:58.464904Z","title":"Policy lea rning” without”overlap: Pessimism and generalized empirical bernstein’s inequality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.464904Z"},"links":{"cited_paper":"/paper/2212.09900","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c4d7a9b4858564c9683bc46dcfd98ef81ba1f2b194ee36cd3ed2e0a74944e4fa","observation_id":"33ecec2d-451b-42fb-8475-e8cb28bee0c2","resolution":{"observed_at":"2026-08-12T17:43:58.464904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.041085Z","title":"Optimal oﬀ- policy evaluation from multiple logging policies","venue":null,"work_id":"41506064-9283-4b27-a79a-60a2f800a9bc","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.468517Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:02e8737c3c42a6c24e532def730b12a0d720f479f5a1be9153e33e265117b307","observation_id":"73586c0e-5b7c-464f-9f2b-1fd543b59673","resolution":{"observed_at":"2026-08-12T17:43:59.044609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.031004Z","title":"Policy evaluation and optimization w ith continuous treatments","venue":null,"work_id":"cebf13fe-dc82-40f7-b70d-f21f59423544","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.471851Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:8027da3160911ed72c3c6f16f362c9d3eb6a35c208986ddb03fc732c20ed83a3","observation_id":"1415e787-1b6c-4ec2-8a14-6cd007dc1bf8","resolution":{"observed_at":"2026-08-12T17:43:59.034761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.021572Z","title":null,"venue":null,"work_id":"3021a783-4d19-48c6-85a0-02adb2a0dea5","year":2007},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.474877Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:33db0d5c3028e38b6f3eac2b3fecd0efed6379f1c45cb8108b6a393481471bfd","observation_id":"7fe2337c-4657-423b-b733-7b91b5f3a839","resolution":{"observed_at":"2026-08-12T17:43:59.024823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.011792Z","title":"Oﬀ-po licy conﬁdence sequences","venue":null,"work_id":"aabd0a66-4186-4155-87ea-4e5f2d425200","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.477767Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:d5bf7f12ff62a080c8a86c09f64af0d783a9eb230a07041d89fd52cdd8717598","observation_id":"2bd7d3f3-db7f-4c00-af86-588d5af2e177","resolution":{"observed_at":"2026-08-12T17:43:59.015260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05308","last_updated":"2025-02-20T16:32:53Z","snapshot_observed_at":"2026-07-06T08:56:56.465174Z","submitted_at":"2020-02-13T02:04:17Z","title":"Efficient Adaptive Experimental Design for Average Treatment Effect Estimation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05308","snapshot_observed_at":"2026-08-12T17:43:58.481508Z","title":"Eﬃcient adaptive experimental design for average treatment eﬀect estimation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.481508Z"},"links":{"cited_paper":"/paper/2002.05308","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:fdfcf972cf25d37ad56e6a493eb1f41a15875e24891e3d70f83e8541739cc82e","observation_id":"ef8513de-cbe9-4a65-8952-3db835d22697","resolution":{"observed_at":"2026-08-12T17:43:58.481508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.001678Z","title":"Irregular identiﬁcation, support conditions, and inverse weight estima- tion","venue":null,"work_id":"3fc216ac-9703-44ae-8b18-773600ec70ca","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.484430Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:1af4a2af884dafbd72767ec2d9b8cfd1081a2bd1a195f86da7a7ebe33338683c","observation_id":"70e4033f-2abc-4256-af5e-2f3bbe37c276","resolution":{"observed_at":"2026-08-12T17:43:59.005109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.991678Z","title":"Asymptotically eﬃcient ada ptive allocation rules","venue":null,"work_id":"9ef6d6d4-dc1a-4ad1-8f13-829ba7dab8db","year":1985},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.487162Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b932653d628533304ea771bf7ac6e15bebb3f6693afe5280c4a61cd6739717e7","observation_id":"c9c49b9a-9ba4-470a-b4ba-53cfe7aa30da","resolution":{"observed_at":"2026-08-12T17:43:58.995176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.489678Z","title":"Bandit algorithms","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.489678Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:8235829ddf5727422e45282b6496ed391de7f42a4255341dc15c91a0f66dcd73","observation_id":"8340bea5-6a62-4d7d-9302-6f9027d95a2e","resolution":{"observed_at":"2026-08-12T17:43:58.489678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.976368Z","title":"Local metric learning for oﬀ-policy evaluation in contextua l bandits with continuous actions","venue":null,"work_id":"2773ae72-a979-43aa-9094-f33f6f44abf5","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.492191Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a908772d23c89e1d2ac6fec818db549b007f5d10b5872f6fe04c1e3f10e93bee","observation_id":"71145d63-232b-40ae-af3c-f59f7086d9c7","resolution":{"observed_at":"2026-08-12T17:43:58.979962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.967762Z","title":"Distribution-free assessment of population overlap in observational studies","venue":null,"work_id":"541942cb-12e4-4810-af90-f07657db8e1e","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.494876Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:cf7d28cb26497a41f9d018ba56214a93dfebf34bd064e893e57916825c5f518d","observation_id":"59b946f9-4f6c-4513-956b-4e5b40cb731d","resolution":{"observed_at":"2026-08-12T17:43:58.970619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.958442Z","title":"Sharp high-probability sample complexities for policy evaluation with linear function approximation","venue":null,"work_id":"7a0359bd-968e-426a-989c-80c792812d35","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.497374Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:85e860d924ff4e9f4d96157c7f9eceee7b6aedeb6f94a7271e3ad474199aaa0f","observation_id":"74c1930e-a5a0-49b4-a907-d89f17998b77","resolution":{"observed_at":"2026-08-12T17:43:58.961990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.948613Z","title":"Toward minimaxoﬀ-policy value estimation","venue":null,"work_id":"436ffda5-ec79-4f66-a41f-96199defea2e","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.500400Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:7415b96f58f9fe0cac493a17c5e1aefc9465fade83a43c8fab6f30a70695be39","observation_id":"514c7f5d-4fe5-41ad-b7f4-1a26385c3c6b","resolution":{"observed_at":"2026-08-12T17:43:58.952463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.939356Z","title":"Statistical analysis with missing data , volume 793","venue":null,"work_id":"fa5f3019-564e-44da-a99e-cb20ea19642b","year":2019},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.503586Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:164fd538b158cdc7df32348b2e362f5f09f3f37dbe31417097b09cba73ceb248","observation_id":"702998d8-e69f-46f9-a818-9ed76ae8d96e","resolution":{"observed_at":"2026-08-12T17:43:58.942657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.929794Z","title":"Statistical infer ence for the mean outcome under a possibly non-unique optimal treatment strategy","venue":null,"work_id":"1693cc8b-e127-41b7-b00f-3b5a68db755d","year":2016},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.506578Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c26bc1f04083507c96d5b585174973b604ef6a17d05a57b7ef55b45f47cbcbcb","observation_id":"4f599360-83c2-46fe-a12f-0d273eef2325","resolution":{"observed_at":"2026-08-12T17:43:58.933079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.920399Z","title":"Min imax oﬀ-policy evaluation for multi-armed bandits","venue":null,"work_id":"a691970c-4d48-4711-a703-d3c1369db2ca","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.509538Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c4018821d49a9d6266ae2ec7baeba624a63e3ec02bf74f71c1d1c32d07a188ff","observation_id":"880a205a-4902-443e-ad93-6d7f137db380","resolution":{"observed_at":"2026-08-12T17:43:58.923814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13075","last_updated":"2022-09-26T23:50:55Z","snapshot_observed_at":"2026-08-13T14:18:50.085165Z","submitted_at":"2022-09-26T23:50:55Z","title":"Off-policy estimation of linear functionals: Non-asymptotic theory for semi-parametric efficiency","version":1},"cited_work":{"arxiv_id":"2209.13075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.13075","snapshot_observed_at":"2026-08-12T17:43:58.634819Z","title":"Off-policy estimation of linear functionals: Non-asymptotic theory for semi-parametric efficiency","venue":"math.ST","work_id":"89f2c561-fd7d-47d7-a77b-838dd61e8fd0","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.512501Z"},"links":{"cited_paper":"/paper/2209.13075","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:7472e70d649a6d8305c6b7c5cbceaaadfacc041a9ced80bae6b6aa86e9d7740d","observation_id":"bceb8c21-f1ac-4b72-a0dd-d67635c8d435","resolution":{"observed_at":"2026-08-12T17:43:58.640071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.911277Z","title":"Eﬃcient counter factual learning from bandit feedback","venue":null,"work_id":"9ac8f45c-5da3-4462-b1f2-842b47754304","year":2019},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.516147Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:425c1e9aa0a372a08aeb3c2be5d240a821deb5a3ff234ec610ffd1aada517a67","observation_id":"54415f53-83e2-4302-bbeb-06c16943141e","resolution":{"observed_at":"2026-08-12T17:43:58.914524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.901807Z","title":"Oﬄine policy evaluation in large action spaces via outcome-oriented action group ing","venue":null,"work_id":"0260f793-6c96-46ea-bb9b-7fc9fa0b31ed","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.519430Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:864385944eb67e5969a4375d210f44559423b8834f3fd17a1f3f9f22f05b5400","observation_id":"c620aecc-93d6-472a-8f1d-1ebf3afd61b4","resolution":{"observed_at":"2026-08-12T17:43:58.905104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.893839Z","title":"Online non-parametric regression","venue":null,"work_id":"496c9dc1-d6c4-40f3-828e-6ea8652f6cbc","year":2014},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.522574Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:181a40e4e57fcb1ee36bfb719616366b372e04cd76f41b46f1d1cf3d13e465b6","observation_id":"70e47d55-6214-43f6-80ad-4964406a5e51","resolution":{"observed_at":"2026-08-12T17:43:58.896509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.885630Z","title":"Seque ntial complexities and uniform mar- tingale laws of large numbers","venue":null,"work_id":"18c849f9-0c4d-428b-8a6d-f2529f3de622","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.525570Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:7cae632ab7018159bd196bf9c36c426502ac69a61f26baddb786012e7dc11a6f","observation_id":"6a50acc1-fa07-4676-9d78-ace03cdeeb35","resolution":{"observed_at":"2026-08-12T17:43:58.888627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.876713Z","title":"Relax and ra ndomize: From value to algorithms","venue":null,"work_id":"90b0af14-9ef5-4bad-938b-2805969da01c","year":2012},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.528627Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:4c8f57c4d5f527f17879f98f3dd5662f033f741a56c44bf87ddb48d46a1e964f","observation_id":"0ad9acdd-50b3-4190-98a3-c0138b3c4caf","resolution":{"observed_at":"2026-08-12T17:43:58.879912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.866902Z","title":"Comment: Performance of double-robust estimators when” inverse probability” weights ar e highly variable","venue":null,"work_id":"65f6fcae-ef87-4e05-9726-d4ce452b17bf","year":2007},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.531540Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:2dfab129adc7cafb3324100e3395304a76be90cea0a3d863705c2427fd02a002","observation_id":"61554459-13d2-46f6-85d9-e83c8c8689db","resolution":{"observed_at":"2026-08-12T17:43:58.870744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.857009Z","title":"Semiparametric eﬃciency in multivariate regression models with missing data","venue":null,"work_id":"d19ca8bf-7de8-4d7c-b4ad-fc9080ff5033","year":1995},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.534555Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:67a172b1bd4b337be02993133705ac82dcce32931f3e75059f915b0c36e16c7b","observation_id":"17d2bccb-68fd-429f-bd91-b582d4ae5e5d","resolution":{"observed_at":"2026-08-12T17:43:58.860460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.847596Z","title":"Estimatio n of regression coeﬃcients when some regressors are not always observed","venue":null,"work_id":"39519790-2280-41ff-b58a-d52a6d6f0e73","year":1994},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.537719Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:2e31e077cf5b34da4d7a049946f56776e15650c5b563824d981ec9946ce7c7c1","observation_id":"2ef21956-0e7a-464d-b7e4-54e89463da98","resolution":{"observed_at":"2026-08-12T17:43:58.851091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.838004Z","title":"Analysis o f semiparametric regression models for repeated outcomes in the presence of missing data","venue":null,"work_id":"f85f0a4f-0919-4a21-b3c5-2d4a493b832c","year":1995},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.540801Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a730a3cda34d919261cf84160b9c480314b9f54966dd994f7c28e5ae501417f5","observation_id":"d4c43c02-d4e0-4815-9509-efa4d20b4331","resolution":{"observed_at":"2026-08-12T17:43:58.841575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.828457Z","title":"A tutorial on thompson sampling","venue":null,"work_id":"25e73551-cd49-4567-ab01-bb112254b170","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.543919Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b27d650e1b2bda6e982744f2aa61b56c3859d7e293c0634ba1fb25022de6db0c","observation_id":"df24683d-c045-4d2b-b50f-09943e68d932","resolution":{"observed_at":"2026-08-12T17:43:58.831606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06317","last_updated":"2022-06-16T00:15:19Z","snapshot_observed_at":"2026-08-13T16:42:14.673209Z","submitted_at":"2022-02-13T14:00:09Z","title":"Off-Policy Evaluation for Large Action Spaces via Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06317","snapshot_observed_at":"2026-08-12T17:43:58.546929Z","title":"Oﬀ-policy evaluation for larg e action spaces via embeddings","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.546929Z"},"links":{"cited_paper":"/paper/2202.06317","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ab2da2650b18814da4b334ede42c2551de4cb3ebf57ab85a2a4017795e7f5bb8","observation_id":"7dcc1f49-cef1-4b27-a663-9803d30b5ea5","resolution":{"observed_at":"2026-08-12T17:43:58.546929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.819348Z","title":"Oﬀ-policy ev aluation for large action spaces via conjunct eﬀect modeling","venue":null,"work_id":"0067cafe-1f03-4dc3-aeee-de8246d2aa40","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.550231Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:5617787c8ddaec1288114608f411d496a0bd8d211d584c3d1af146d7e8cf9798","observation_id":"de50d675-da0e-4cb4-8ef2-25962971d72f","resolution":{"observed_at":"2026-08-12T17:43:58.822558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.811046Z","title":"Lear ning from logged implicit exploration data","venue":null,"work_id":"a8a37e35-74c9-4dfb-8d75-25edaa3ea8ce","year":2010},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.553443Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:79a1023deb955fe31378cd292d92ebd92aa147b9ebcfc68831fdfbab3170ae4d","observation_id":"2b63066d-06c7-41c8-b289-5469d9008d7f","resolution":{"observed_at":"2026-08-12T17:43:58.814022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.802973Z","title":"Doubly robust oﬀ-policy evaluation with shrinkage","venue":null,"work_id":"833c0527-08a3-491e-a86a-fd6ae14d33de","year":2020},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.556638Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:fb7f38bbd61b04d3e4bc8d3d80d81d136ed8f21b86cf1b7a007ed83727baa0d9","observation_id":"b6bdbb72-811a-4e54-9836-42f2ed0d9109","resolution":{"observed_at":"2026-08-12T17:43:58.805656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.794823Z","title":"Cab: Continuous adaptive blend- ing for policy evaluation and learning","venue":null,"work_id":"b6326560-94d1-48af-9bf0-2d976a2bf994","year":null},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.559742Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:e134a98e3338b9982e6f7df6b6be804fbd2ff9b43b1ec61ec4d09a3b9d99c3e1","observation_id":"8b319e47-8d66-4cf5-ad49-7037c7300635","resolution":{"observed_at":"2026-08-12T17:43:58.797671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.785812Z","title":"The self-normalized estimator for counterfactual learning","venue":null,"work_id":"cb058f45-9917-4294-a408-fec4c938af9e","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.562987Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b22885eb44012a7ea225ab6791285ddbf7a81a598624c24d48a5226b14035b25","observation_id":"ecde691c-e9cc-4d95-b1c5-d1544122943d","resolution":{"observed_at":"2026-08-12T17:43:58.789061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.776893Z","title":"Data-eﬃcient oﬀ-policy policy eva luation for reinforcement learn- ing","venue":null,"work_id":"21a7e7f0-0be7-4ef4-b12f-84339a2c3e14","year":2016},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.566553Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ca7a5baf73eaab8fbc011fe7bbf00bba831a117ebe447bfbefde35d6f00559d9","observation_id":"e38b07e5-19f9-49d3-a04b-42ea05405a31","resolution":{"observed_at":"2026-08-12T17:43:58.780101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.767614Z","title":"On the likelihood that one unknown probability ex ceeds another in view of the evidence of two samples","venue":null,"work_id":"a1e06b7d-a608-4911-8e02-ded4a8eb3684","year":1933},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.569592Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c7ae6280b8e9412563ad4bf99d0732e4ff7aff57ec8c73342d2066adb3315235","observation_id":"c73b29ef-8313-497e-9d84-de6f5950c774","resolution":{"observed_at":"2026-08-12T17:43:58.771008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.758108Z","title":"The construction and analysis of adaptive group sequential designs","venue":null,"work_id":"bb202482-9ca8-43fa-bb36-a35bf8779cb3","year":2008},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.572740Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:29c51e58e74a4e52ff2dfc9ad27b362009751a9ab85a0b299c1211bdca5d110a","observation_id":"d4634878-2d7b-4c84-a5b6-a07f3bddd642","resolution":{"observed_at":"2026-08-12T17:43:58.761483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.748984Z","title":"High-dimensional statistics: A non-asymptotic viewpoint , volume 48","venue":null,"work_id":"e40fd2f1-4986-4e9f-9c77-e1816df073c1","year":2019},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.575839Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:9eae1e705db85e43a22b2c3c19cda77d82756f4ffbd95e1e2bee1600890a683a","observation_id":"55ff0e85-6000-421d-8fef-6a9d3b9cd250","resolution":{"observed_at":"2026-08-12T17:43:58.752267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.739737Z","title":"Oracle-e ﬃcient pessimism: Oﬄine policy optimization in contextual bandits","venue":null,"work_id":"59dd5909-48fe-4e54-a144-ec162b16138c","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.578928Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:1925f29a0251f45713de0d3d80d462d09dce8c0b409dab2c38f3ff832c967d4b","observation_id":"0525e20e-def8-4f05-90d4-6c53dfd5e888","resolution":{"observed_at":"2026-08-12T17:43:58.743269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.730348Z","title":"Optimal and ad aptive oﬀ-policy evaluation in contextual bandits","venue":null,"work_id":"add7444b-1244-4c63-adb7-b9d212663d48","year":2017},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.581648Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:1a736006ee75e42628e7938bbee52db240f262d5a064a124cc58d598e9f8064e","observation_id":"0ac61766-8332-43d3-b8f1-f7864532a8c4","resolution":{"observed_at":"2026-08-12T17:43:58.733433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.721301Z","title":"Anytime-valid oﬀ-policy inference for contextual bandits","venue":null,"work_id":"12a593d2-0270-468c-8fe2-2cf3e666a3f3","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.584182Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:862d89e7f683a8d506e900a7f211c30a149fb7d741421925687199947d53d4b2","observation_id":"649e6e36-317d-4fea-b7b2-eea3bb886478","resolution":{"observed_at":"2026-08-12T17:43:58.724253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.712444Z","title":"Asymptotic inference of causal eﬀects with o bservational studies trimmed by the estimated propensity scores","venue":null,"work_id":"6bb1450d-4bc5-46be-b568-1880329ea4d4","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.586736Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ad1a280162a96f0cf12aebc4e51aa0f19d43bc293520476893fbb5710de51f96","observation_id":"88d8437e-3d16-4f29-bd16-c7139087686d","resolution":{"observed_at":"2026-08-12T17:43:58.715417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.702791Z","title":"Oﬀ-policy evaluation via adaptive weighting with data from contextual bandits","venue":null,"work_id":"b011a9d3-4b42-4135-a108-f3c99614aed0","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.589198Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:63972189be04e8c51ee60d5b16ee8721ce1356a9ee1389fa08f9319f0cde899c","observation_id":"101db0d1-b20d-4d34-b628-83ec133cee91","resolution":{"observed_at":"2026-08-12T17:43:58.706252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.693002Z","title":"Policy learning with adaptively collected data","venue":null,"work_id":"323f6767-fd26-44a2-b497-c105fdc1ad1d","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.591909Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:e906c5e4def2deaac3b37dcae546997879f466300fd8b1205222dc381a9379c2","observation_id":"7a83b08d-89d3-434a-b576-448588353f15","resolution":{"observed_at":"2026-08-12T17:43:58.696569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.682544Z","title":"Inference for batched bandits","venue":null,"work_id":"9a563593-50f9-42e0-9f79-14e05e51fa96","year":2020},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.594829Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:7ea3332e5f39fe03310b9436c47578a6189ffb7e86b21471526545f5959f9fa4","observation_id":"755424cb-481b-4825-a410-50b2442d6e48","resolution":{"observed_at":"2026-08-12T17:43:58.686245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":60},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2411.12786."}