{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec1eceffde934e979612a6615f6b24b996dae78e24cdfe39195546ec63576c36","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:17:01.124208Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22492/citation-record","integrity":"/paper/2505.22492/integrity","json":"/paper/2505.22492/citation-record.json","paper":"/paper/2505.22492"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:52.903422Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:52.903422Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:4f01921d7973b985ffca1299f8cf05dec65828002b9662b74f0e667fa47930dc","observation_id":"fe970c9f-0548-4569-aaa3-4eab2ff15df9","resolution":{"observed_at":"2026-08-07T13:16:52.903422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.021013Z","title":"and Kallus, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.021013Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:6994f64dfc198a5e834215a6f88c15df3d86ece5b6ae8a65a3673dbbd24834ed","observation_id":"b62aa258-e78b-4938-bb97-799ce524f0ef","resolution":{"observed_at":"2026-08-07T13:16:53.021013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.103572Z","title":"Off-policy evaluation in doubly inhomogeneous environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.103572Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:fe5f40459e533aa1a681c5eb41077732b0d8234cee6d8d44d7952cd5f3227639","observation_id":"3b741a11-b4dc-4569-b70d-945c5839b408","resolution":{"observed_at":"2026-08-07T13:16:53.103572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.186263Z","title":"More efficient off-policy evaluation through regularized targeted learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.186263Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:5d7043bdba72c61884cf56435ffa78c3b8811ce1484a1f8daf3c1ac216508e14","observation_id":"440371c0-981b-4670-bec6-f0aacf55fdae","resolution":{"observed_at":"2026-08-07T13:16:53.186263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.264406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.264406Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a944520213aa34045cf35f6999d2168ad80b330ac715c0fa93a8da0db9596b7e","observation_id":"342ab1ad-17f1-455a-9f63-4a19cc565efe","resolution":{"observed_at":"2026-08-07T13:16:53.264406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T13:16:53.388701Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.388701Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:85d94554011bba37a57df21e56201840dbf2bcb2dfb5e6d10a3abeab20cc7f70","observation_id":"552f657a-6eda-4337-a6d5-a218da5e2d98","resolution":{"observed_at":"2026-08-07T13:16:53.388701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2302.00662","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:04.645023Z","title":"and Zhou, A","venue":null,"work_id":"903c5ca2-f37d-4ebd-808f-c1fdee1684c5","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.496289Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:dc462a443a3ef03632a4d4dbff6ec49ee7bacd9eb6b6be3ded38ee157c136251","observation_id":"c6c5e743-b5b3-4cbb-aebf-ad81d8d95b29","resolution":{"observed_at":"2026-08-07T13:17:04.709883Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08697","last_updated":"2025-07-03T23:10:51Z","snapshot_observed_at":"2026-07-06T18:29:58.140132Z","submitted_at":"2024-06-12T23:41:43Z","title":"Structured Difference-of-Q via Orthogonal Learning","version":3},"cited_work":{"arxiv_id":"2406.08697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08697","snapshot_observed_at":"2026-08-07T13:17:04.411213Z","title":"Structured Difference-of-Q via Orthogonal Learning","venue":"stat.ML","work_id":"bc5f8a07-d8fc-4308-a4cd-efe114748cf3","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.610687Z"},"links":{"cited_paper":"/paper/2406.08697","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:491baedf73289ea9d7c6f3ef57b7269164ed8c9a954187a4127baf8a3f0835dd","observation_id":"8a06d0b8-b9d7-40c3-916f-86b10aa7c50a","resolution":{"observed_at":"2026-08-07T13:17:04.447238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.686598Z","title":"and Berger, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.686598Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a97e32bb07fe5da0bd492da77ee5204c724b6bcf0b7399fb74f947fc466d54dd","observation_id":"67a52a5d-4608-4582-a6c2-bd0f88c6a259","resolution":{"observed_at":"2026-08-07T13:16:53.686598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.794136Z","title":"and Li, L","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.794136Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cc6f1dd39b597b02c80cd667047b89435b2993665c9f5b642da10577cf6da32d","observation_id":"bc2ae633-0ad7-44ca-a0db-07a0658b0efa","resolution":{"observed_at":"2026-08-07T13:16:53.794136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.924369Z","title":"and Jiang, N","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.924369Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:67aa23b8070d7dd88995cd003f529279aecee89284db82fc0d3f0918557670c6","observation_id":"49de3aaf-d1f8-4dbd-a4a4-759ad9b84b90","resolution":{"observed_at":"2026-08-07T13:16:53.924369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.023087Z","title":"and Qi, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.023087Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cf3afccba990c3075d7cc195d2604ee26e8f72ac18d3827e3bed915cf2b46c8f","observation_id":"b8a8b783-825e-4208-95fc-5d209ea87241","resolution":{"observed_at":"2026-08-07T13:16:54.023087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.133862Z","title":"Gaussian approximation of suprema of empirical processes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.133862Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:3fa08a9601870a8104a78d13ee33384553abbc0002f3dad748c024c4b447d422","observation_id":"fca476a0-cfa0-4d92-ab2b-9bf5fb2ca2f7","resolution":{"observed_at":"2026-08-07T13:16:54.133862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.246149Z","title":"Double/debiased machine learning for treatment and structural parameters","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.246149Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a60e760763e45569d72029ca0da0ea46ecf3325d370c060bac355af87ff92944","observation_id":"52b4bb87-f570-4feb-84e1-1403a8ab136a","resolution":{"observed_at":"2026-08-07T13:16:54.246149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.339217Z","title":"Coindice: Off-policy confidence interval estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.339217Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:42fc866ba7e91dcb9d337ed85450f3a0e4092c0ec924ed6177e4a8911f61c151","observation_id":"db63a9a8-f309-47aa-acac-bd6bb2d1c379","resolution":{"observed_at":"2026-08-07T13:16:54.339217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.432077Z","title":"Doubly Robust Policy Evaluation and Optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.432077Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:291b02862af1306287396fed31e73d252cfe50a44c121a53edc438bf2c21a4de","observation_id":"0a9c8274-3776-490b-a0ed-558411d6bf08","resolution":{"observed_at":"2026-08-07T13:16:54.432077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.524675Z","title":"A theoretical analysis of deep q-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.524675Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e9110743239081791f05ee56520c2610415e7817e563bddc6a44f7386d836a8c","observation_id":"8446019f-3832-4df8-9d51-6b1368b142b9","resolution":{"observed_at":"2026-08-07T13:16:54.524675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03493","last_updated":"2018-05-23T18:13:43Z","snapshot_observed_at":"2026-07-06T06:22:40.962594Z","submitted_at":"2018-02-10T01:32:03Z","title":"More Robust Doubly Robust Off-policy Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03493","snapshot_observed_at":"2026-08-07T13:16:54.617714Z","title":"More robust doubly robust off-policy evaluation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.617714Z"},"links":{"cited_paper":"/paper/1802.03493","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:fbb5781c01ffeaf37099700bf91e133a76bd2542b08b7791b1375dd54b2195c8","observation_id":"25caa724-aca7-4a07-b9f0-dda5c47cd091","resolution":{"observed_at":"2026-08-07T13:16:54.617714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.732514Z","title":"Accountable off-policy evaluation with kernel B ellman statistics","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.732514Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:b0fb21de4826041135ce2f8a7753de4e4145628eabcecb7e50f2cbd4152f312b","observation_id":"69d160b1-511b-4984-a4d4-ec8006edc122","resolution":{"observed_at":"2026-08-07T13:16:54.732514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.828722Z","title":"Combining parametric and nonparametric models for off-policy evaluation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.828722Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e7be742119d1714b68735cb204e743026101b8dbfa6e60a4025ed5e22519784f","observation_id":"1d2f3fc2-4499-45b8-ae5c-0061bd1e4779","resolution":{"observed_at":"2026-08-07T13:16:54.828722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:15.050550Z","title":"D., Thomas, P","venue":null,"work_id":"2c4d5e57-a0bf-4659-a57c-1d295f376a3a","year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.910774Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:15122fe1da0369dba12b1c6ddd124c21990c3bea6f64f720682b412120bda13b","observation_id":"3e674bf6-aede-4609-a97b-8498caf0fb30","resolution":{"observed_at":"2026-08-07T13:17:15.124519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.915589Z","title":"Importance sampling policy evaluation with an estimated behavior policy","venue":null,"work_id":"719f7a58-2fa5-4da4-9e9f-672d10103f97","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.995797Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:7c78137afd9f3d5bd009e67d5a02354b3f1d5ef804ce96957911cf770308882b","observation_id":"238d6f10-29ef-4d5b-b3bf-b06331b78393","resolution":{"observed_at":"2026-08-07T13:17:14.980638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.749329Z","title":"P., Thomas, P","venue":null,"work_id":"72d9915f-df62-4c50-8e2f-561d29172e27","year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.071207Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e46ba36508a21d0857e4a59058ae6ffbe7fcf1fa28acbe616e84b2762f702993","observation_id":"715be3ee-ce98-4c84-ac12-c5babdbdda54","resolution":{"observed_at":"2026-08-07T13:17:14.829766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.604182Z","title":"P., Niekum, S., and Stone, P","venue":null,"work_id":"d55aeb29-2251-4512-aa57-c93c11d50dac","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.196586Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a6be58f70ada30149e9ef9aba6ccc8f0f5c8696093a450d2f0d1ce1bb01fdf51","observation_id":"5db9c47a-84a6-4898-9dc1-e9c7a05cdcd1","resolution":{"observed_at":"2026-08-07T13:17:14.679690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.443424Z","title":"Bootstrapping fitted q-evaluation for off-policy inference","venue":null,"work_id":"443c7426-970c-416e-b0ab-b98a713a1be5","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.317248Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e16d763cf834c0c03e0fb2b7b7ae1d04e1c2775dc5551c77bbdcb84b7420d312","observation_id":"9c90fb45-6232-4e37-b518-1c03af849c8c","resolution":{"observed_at":"2026-08-07T13:17:14.525737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.319733Z","title":"Importance sampling via the estimated sampler","venue":null,"work_id":"04745017-68fc-4138-ac7a-27460a024bb1","year":2007},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.387170Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:008d3786741f9a5b8288424e79b0f1ed7da215bccd687fa754c6c47e2ae2c1e0","observation_id":"891b15a5-8bf1-45dc-abba-88a38f30a1b1","resolution":{"observed_at":"2026-08-07T13:17:14.384125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.099450Z","title":"W., and Ridder, G","venue":null,"work_id":"93e9a43e-5431-46f9-b9a7-df28e97edcaa","year":2003},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.459117Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cbdd43393c5715af938c318d5d6134cd61cc13e8edcd1b1b8fee59cbdb267617","observation_id":"2ad6d719-9b29-446e-a5d2-f9e1a16fc9ca","resolution":{"observed_at":"2026-08-07T13:17:14.222790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:55.534857Z","title":"and Wager, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.534857Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:d31bc9ef69dbf5cdd0569a7df6b941ffd38e455c7cfdca3707a7c9f08151bfe3","observation_id":"db7f3592-4268-4450-ba42-a0663dfe4af2","resolution":{"observed_at":"2026-08-07T13:16:55.534857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.947408Z","title":"and Li, L","venue":null,"work_id":"2c9fef03-de7f-41e7-aaf0-80afb3885778","year":2016},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.616369Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:6511080929709951dd2d3d63241907bfc0818375d7ad2365f11513f48c251805","observation_id":"ff3d687f-0b80-4dd4-a4d7-db5b0d93866d","resolution":{"observed_at":"2026-08-07T13:17:14.029859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.698454Z","title":"and Uehara, M","venue":null,"work_id":"d926e134-57cb-4bfb-861e-73bee86b03cb","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.716241Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:67c4848ae8a3429b26b44ae461476ef5000250c4a33cc237dd5fadeb4b5161f7","observation_id":"a42c0dd8-5648-4354-b424-84d1a4e77faa","resolution":{"observed_at":"2026-08-07T13:17:13.838362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.542001Z","title":"and Uehara, M","venue":null,"work_id":"e2876d6b-b544-461b-a38a-6e93ef5666d8","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.793014Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:7eee8a4e179e331031ac52e98291c2ba6218d853f11ea29835794210944e5be9","observation_id":"d404d600-7de2-4150-946b-5307bac95f8c","resolution":{"observed_at":"2026-08-07T13:17:13.626828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.307344Z","title":"and Zhou, A","venue":null,"work_id":"4d5f3d1c-c83c-4b97-bafa-1ef42137f520","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.872168Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0549b46deac70bae9bd0221d7ed1292fccb5a35b34d899d53a257d956c711423","observation_id":"6411d0f2-b200-46ad-b612-6dd15b17e52c","resolution":{"observed_at":"2026-08-07T13:17:13.420849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.048518Z","title":null,"venue":null,"work_id":"612d3274-d6c3-41cb-a076-699467d48443","year":2008},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.932696Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:eaa6fc2de034946e2b24bc7b7215e1bcb4d600e3c5e482e75dd39db29daab20d","observation_id":"63221bff-3c62-45ab-9178-79969858e05b","resolution":{"observed_at":"2026-08-07T13:17:13.160576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.855828Z","title":"Batch policy learning under constraints","venue":null,"work_id":"bc37e5d9-508b-4f92-93c8-8a4507cd91ba","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.017006Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:1eb61877e5ca3621504d1b6f65fc608125bfda7f8734b14b862ac725447a393e","observation_id":"5a9cc8b5-daf7-428d-9acd-b4d241a9daf0","resolution":{"observed_at":"2026-08-07T13:17:12.937701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:16:56.144780Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.144780Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:77e332472c7d44b82454df0dc2c2c8f0102c4c5b9d9c9b344a04b3dda4c72b99","observation_id":"1924c1ed-bc7b-4f1b-98f6-816e702217d1","resolution":{"observed_at":"2026-08-07T13:16:56.144780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19001","last_updated":"2024-05-02T07:49:00Z","snapshot_observed_at":"2026-07-06T15:35:22.185803Z","submitted_at":"2023-05-30T12:58:39Z","title":"High-probability sample complexities for policy evaluation with linear function approximation","version":2},"cited_work":{"arxiv_id":"2305.19001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.19001","snapshot_observed_at":"2026-08-07T13:17:04.090075Z","title":"High-probability sample complexities for policy evaluation with linear function approximation","venue":"stat.ML","work_id":"3624e0ea-1bcb-441b-b5da-ebb8739c18c3","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.248494Z"},"links":{"cited_paper":"/paper/2305.19001","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:45c62e4f5344a272dd180ab72a4b14982d74cf88b22532e29ab2a09a35b23889","observation_id":"977884f7-69c5-4e80-aa98-3b38ff7c87f1","resolution":{"observed_at":"2026-08-07T13:17:04.262424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.704609Z","title":"Off-policy estimation of long-term average outcomes with applications to mobile health","venue":null,"work_id":"743ee5fa-8c6e-4ba7-99fe-45755cb27832","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.359148Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:6b512464d0e2512c646c8ec3d702cbf8203c810a3dd56b0717fcb78adabd81cd","observation_id":"38ccf486-2bf4-47ce-91d8-e2cb5ef3fff3","resolution":{"observed_at":"2026-08-07T13:17:12.773972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.556256Z","title":null,"venue":null,"work_id":"878f76dd-af83-4f0c-92e3-3cbd6063f450","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.466433Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:1efe02ada5bedcbb89d2aa9d215b558e538ea7197a91a64f4768bb31c496d2c9","observation_id":"67f38c91-6c96-4360-9f51-f15cbc3b435a","resolution":{"observed_at":"2026-08-07T13:17:12.624851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.396586Z","title":"Breaking the curse of horizon: infinite-horizon off-policy estimation","venue":null,"work_id":"6cd9d54c-13c7-48c4-83de-c2970d05353d","year":2018},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.565112Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:ddb1d52a8260c6d6b3313349daaf9a5febbe105dcefa2bea0207055242fadff3","observation_id":"03b93b2d-2ad1-411f-9a43-8b252edd6bf6","resolution":{"observed_at":"2026-08-07T13:17:12.478362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.165788Z","title":"and Zhang, S","venue":null,"work_id":"d6f65545-820f-49d6-bf89-d7b7c327a4e2","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.671738Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:347b8d8492b6a900576fe84f9317584ac31b843c959439837e884ea5c96f926b","observation_id":"b1b84187-62f8-49de-bd51-6289711aa20c","resolution":{"observed_at":"2026-08-07T13:17:12.254767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02226","last_updated":"2025-03-20T05:00:23Z","snapshot_observed_at":"2026-07-06T19:26:49.672415Z","submitted_at":"2024-10-03T05:47:55Z","title":"Doubly Optimal Policy Evaluation for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02226","snapshot_observed_at":"2026-08-07T13:17:03.755725Z","title":"Doubly Optimal Policy Evaluation for Reinforcement Learning","venue":"cs.LG","work_id":"8b833e22-96d0-4b69-9736-04a3f042d22a","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.740396Z"},"links":{"cited_paper":"/paper/2410.02226","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:02d29b5725a0ae67eb988b772eb7bdebbd1aa453cdbed65216f793f789586c06","observation_id":"20212785-c506-4558-a002-57494379b523","resolution":{"observed_at":"2026-08-07T13:17:03.912586Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02581","last_updated":"2025-03-01T12:55:13Z","snapshot_observed_at":"2026-08-06T07:06:33.911763Z","submitted_at":"2023-10-04T04:57:35Z","title":"Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.02581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02581","snapshot_observed_at":"2026-08-07T13:17:03.403559Z","title":"Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning","venue":"stat.ML","work_id":"a04a3c1f-d31d-41b6-8641-d6d4459db941","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.834090Z"},"links":{"cited_paper":"/paper/2310.02581","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0d73b1dd0d017a28ceb400fa7692d0a894d6ea887d414e2ecee1b63da81fa676","observation_id":"b6029ff5-5b9f-48b3-9947-4d1d444ba384","resolution":{"observed_at":"2026-08-07T13:17:03.551774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:56.946901Z","title":"J., Laber, E","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.946901Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:96c0cf0233bfcedac07aa69ece51251d9cf8ada9d4af4af8c2051e9074aba3f3","observation_id":"1ed53d7c-3231-44c0-8f6b-0feeedbf69dc","resolution":{"observed_at":"2026-08-07T13:16:56.946901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.029448Z","title":"P., and Nowak, R","venue":null,"work_id":"b043f9bb-4744-495b-a942-5d1c53dfc7e2","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.007129Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:efe959033eb796eba0878a99ce63ccd3d8153afc5dcd9fdbcdbce50bba6db5ea","observation_id":"548001c1-8ac1-463d-adbe-e8cb79d621a4","resolution":{"observed_at":"2026-08-07T13:17:12.077014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.814006Z","title":"A., van der Laan, M","venue":null,"work_id":"c94fc38d-b488-438e-bf38-32da6becedeb","year":2001},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.074159Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a91b858e544bc6441bb48d8bbd97027505088c8e53e67bb213cef130b5f4bf13","observation_id":"e038af15-6e2e-40e6-8d48-d63427dd26d3","resolution":{"observed_at":"2026-08-07T13:17:11.923588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.619131Z","title":"Dualdice: Behavior-agnostic estimation of discounted stationary distribution corrections","venue":null,"work_id":"f2cbe6c2-0770-4969-a211-916afbe7415b","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.135333Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:8407d94673efa5ff484ec54b0e2ece6a965cd6f27dddbd3d36a855e2e6d8bf0d","observation_id":"cb654943-6911-4027-b699-509c2785a743","resolution":{"observed_at":"2026-08-07T13:17:11.691191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10502","last_updated":"2021-09-22T03:36:51Z","snapshot_observed_at":"2026-08-06T07:02:30.814685Z","submitted_at":"2021-09-22T03:36:51Z","title":"A Spectral Approach to Off-Policy Evaluation for POMDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10502","snapshot_observed_at":"2026-08-07T13:16:57.195687Z","title":"and Jiang, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.195687Z"},"links":{"cited_paper":"/paper/2109.10502","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:63025498f9d7db49c01c613e0dc8b980eb6839b4d8e3aadbe13f8083f03bcd89","observation_id":"3bbf4a0c-7e88-437c-ba2e-7be99f60802d","resolution":{"observed_at":"2026-08-07T13:16:57.195687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.433970Z","title":"Off-policy policy evaluation for sequential decisions under unobserved confounding","venue":null,"work_id":"7cb34401-e07b-409b-b0cc-3a5ba29a2066","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.246652Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:860673f6168b39d0c3d35c520d3e0ff785c73e053363b3ddb455223c2ef9f7ba","observation_id":"877ba37c-7916-41a1-bbda-3021e7f63f2b","resolution":{"observed_at":"2026-08-07T13:17:11.540247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.220421Z","title":"K., Hsieh, F., and Robins, J","venue":null,"work_id":"fda25dfb-587a-4314-8578-e35a8c273113","year":1998},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.316362Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:27b3270d43e37f56505497271ab4472847c14b8477672fbe924b097c24bd95db","observation_id":"fe049d9e-3dad-43a7-876b-39568be90b97","resolution":{"observed_at":"2026-08-07T13:17:11.289965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:57.362862Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.362862Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:8fb200d5e6073fe8b7a63f83303c63cada558b8db9f55c4494a591ec70ed0dee","observation_id":"220033ba-5dc0-445d-b8e8-855b2dd8aecf","resolution":{"observed_at":"2026-08-07T13:16:57.362862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.983751Z","title":"S., and Singh, S","venue":null,"work_id":"65a21c55-7d64-49ee-bd48-2708047bf222","year":2000},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.449604Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:7deefcd8a38847bded347a94877ed665262406133ee9b91ea303afaafbddbfc6","observation_id":"7e730401-bf8b-41ff-a17e-a81d69418f46","resolution":{"observed_at":"2026-08-07T13:17:11.104301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:57.519872Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.519872Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:01245aa44f966e62cb35a5b6c1406a90cc3c1c8cdc92257627047a2f4e174627","observation_id":"c5644559-bd83-4111-bc92-4c2224a768b3","resolution":{"observed_at":"2026-08-07T13:16:57.519872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.748848Z","title":null,"venue":null,"work_id":"14d2a442-f0af-4f6c-bb3a-08436118f8b9","year":1983},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.582139Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:665565426570eb6f862a96000e07369525c795f3732ad275dad6de7670805ef0","observation_id":"eb28c104-9602-4e69-8561-9b0715d8a30c","resolution":{"observed_at":"2026-08-07T13:17:10.808173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.585906Z","title":"Conditional importance sampling for off-policy learning","venue":null,"work_id":"b32615fb-6f7e-4036-8c9f-754b3ac3f0d7","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.632221Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:7554523a19026699c73f1e9b0863b2ba7f110900a68b4cccffd2c0ad74f4d4f4","observation_id":"4695e73b-5847-4e3f-82b9-e682b16dc01b","resolution":{"observed_at":"2026-08-07T13:17:10.692678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.338081Z","title":"G., and Dabney, W","venue":null,"work_id":"dc3fd4ed-ddc2-4891-8303-968a81b3efbf","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.718028Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:aad8bcdf620793202fe29064b59dbb379911793b6e68e88b6b2e09a0794f9b1f","observation_id":"a5078da9-a7fa-4985-85d6-b91f6d93ef28","resolution":{"observed_at":"2026-08-07T13:17:10.457993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:16:57.801762Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.801762Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cc1551480b3a2e296d7007af213560a54b771f2d10738a6d30bc4dc9a99fa93e","observation_id":"b9e6c4a0-196f-4998-8a2a-b23b71887564","resolution":{"observed_at":"2026-08-07T13:16:57.801762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.142396Z","title":"Estimating the dimension of a model","venue":null,"work_id":"64a2ef72-e697-4183-89c3-4919b86c5e2a","year":1978},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.866226Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:28bf9312c9cda64ee60f2cc71b2b613026d1c82336d111ce6dc367d89bd6542c","observation_id":"7e7a7233-70a3-4e87-b622-49670b846ed1","resolution":{"observed_at":"2026-08-07T13:17:10.220070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:57.934021Z","title":"and Ben-David, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.934021Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:8904937c13663a2aa05d63065b2691dcb00669fc87c033a0f78dca50cc5daa8a","observation_id":"850e99cd-29f6-4007-a1c9-33882eea3cf1","resolution":{"observed_at":"2026-08-07T13:16:57.934021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:58.022585Z","title":"Mathematical Statistics","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.022585Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:75472ce459db573b06ad6b92a24f3a49ed167ecb12a1c6ff4ec2fdd3760a0006","observation_id":"9afe5e2f-6267-448a-b52c-d34ce187313a","resolution":{"observed_at":"2026-08-07T13:16:58.022585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.934468Z","title":"On methods of sieves and penalization","venue":null,"work_id":"790ba65a-2950-4b34-9c6e-238ef1654f7f","year":1997},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.081016Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:067e1305bc55e7bf4e6114c8005189281d71b57dd6204aaf8f10ace92dff1254","observation_id":"a5a578f7-f424-47bd-9594-7bb5521b9d41","resolution":{"observed_at":"2026-08-07T13:17:10.002895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.760641Z","title":"Deeply-debiased off-policy interval estimation","venue":null,"work_id":"1f2dab69-1a34-425a-8e6f-dfb1bf126ef1","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.143606Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:94d68d051d2c79dc4f04fd6a23eb9ab7025ed9a0430bd346ff8ec0efcfbbe16e","observation_id":"067892b6-6dcf-460f-93c9-2e9dfe291a08","resolution":{"observed_at":"2026-08-07T13:17:09.855972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.556829Z","title":"A minimax learning approach to off-policy evaluation in confounded partially observable markov decision processes","venue":null,"work_id":"e0244e02-6bc0-4252-96dc-bed3ca118bfb","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.211350Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0cec5d801443b464a416ca8f8d4b1db2768578ad3fb7b407ce6eb471a401fe22","observation_id":"3587ffd9-3294-4bd0-b23e-85ae9726279a","resolution":{"observed_at":"2026-08-07T13:17:09.668572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.356091Z","title":"Statistical inference of the value function for reinforcement learning in infinite-horizon settings","venue":null,"work_id":"5c8d7d07-62e8-4a14-a5b7-0eb4a2739f6d","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.281999Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:81337cfbd98b103cc21bd42b86e082910ddee26f31eb6ebc75835c9e664c887a","observation_id":"337a06a4-da2c-4071-a7f1-ce0b1005ff5f","resolution":{"observed_at":"2026-08-07T13:17:09.489721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.113775Z","title":"Dynamic causal effects evaluation in a/b testing with a reinforcement learning framework","venue":null,"work_id":"6cc0b9a1-df1e-49e9-996e-e372dfc8880f","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.378112Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:27f5cb419e5e0eb53d1fca0ae98fa2b370f321f577e0416d72e090ffbefcc88a","observation_id":"d688c1de-2597-498c-a6cf-596f4ba2351b","resolution":{"observed_at":"2026-08-07T13:17:09.222749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.917745Z","title":"Off-policy confidence interval estimation with confounded markov decision process","venue":null,"work_id":"12ffc5ee-aba0-4efa-ba05-d5f0196be863","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.470043Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:2a4f8aa6f5d4bda7013d7a8cd5cd3ce05310a1297ade71604f211038d572a21c","observation_id":"d1a16f9e-e59f-46b5-a50d-514496496e92","resolution":{"observed_at":"2026-08-07T13:17:08.987934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05342","last_updated":"2025-01-11T06:39:01Z","snapshot_observed_at":"2026-07-06T18:59:00.983278Z","submitted_at":"2024-08-09T21:20:55Z","title":"ARMA-Design: Optimal Treatment Allocation Strategies for A/B Testing in Partially Observable Time Series Experiments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05342","snapshot_observed_at":"2026-08-07T13:16:58.476262Z","title":"Optimal treatment allocation strategies for a/b testing in partially observable time series experiments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.476262Z"},"links":{"cited_paper":"/paper/2408.05342","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:fbc22e9b243da405f14e93f5d69ef0b3e03de8dbbe8b83685713ee6c3d819d35","observation_id":"61258582-d81d-4811-8a87-20401a18103d","resolution":{"observed_at":"2026-08-07T13:16:58.476262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.662685Z","title":"S., Szepesv \\'a ri, C., and Maei, H","venue":null,"work_id":"25de5c41-7488-4a09-b26d-1826e2f26f39","year":2008},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.553538Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:9ca0fab437690b2c54e3e40edbaa6176d2fe7ad0dee0620c6b202e2d50e5a01d","observation_id":"02bd134f-5140-496e-867d-2a6dc4b7aea0","resolution":{"observed_at":"2026-08-07T13:17:08.811401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.480046Z","title":"Doubly robust bias reduction in infinite horizon off-policy estimation","venue":null,"work_id":"a51edca6-9642-4dbe-8c80-ce23dd332cd1","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.648961Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:74a29d0fe36c49641f575d01cf1f1e67c82b94a979644cd620f04f0c9bfeba17","observation_id":"a266e348-4d60-4a95-a6c3-91f20e10358b","resolution":{"observed_at":"2026-08-07T13:17:08.583530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.188799Z","title":"Off-policy evaluation in partially observable environments","venue":null,"work_id":"af7e5557-f68f-4b64-87e3-dead7fe44416","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.740428Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:d8a4415645a43457d43e88569c18ea7fc678b3f4a27baa35eefdb74caef9dd7f","observation_id":"bd7a0f40-a240-49ca-9b93-4c4ed5bba7b4","resolution":{"observed_at":"2026-08-07T13:17:08.354914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.017051Z","title":null,"venue":null,"work_id":"68b5d3dc-0654-4a7d-b72e-fd3b1e4b1c54","year":2016},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.839634Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:382c379a1b6d57391ec57818db190f3a57e03e1ae37672646ff037db7dd83484","observation_id":"6b8460eb-5193-457b-a1b5-abfd2a007cdb","resolution":{"observed_at":"2026-08-07T13:17:08.090302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.862572Z","title":"S., Theocharous, G., and Ghavamzadeh, M","venue":null,"work_id":"ff2704dc-2f97-4a65-815d-ad4803ab53a2","year":2015},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.954745Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:6cc1e8a90299808e4957ad979cc6f2f692db73bd4f710487e489c257cb4cc13e","observation_id":"01ac0eea-2e90-47dc-b9e5-108682734923","resolution":{"observed_at":"2026-08-07T13:17:07.914057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.681072Z","title":null,"venue":null,"work_id":"162450ea-bb24-4fb3-9410-eccce0efee7a","year":2006},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.070422Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:ca7e3223468b8d72859560626f9eab5df1cf4a30ad7d6eb9f6767aa6c0091b74","observation_id":"1319aa44-ad66-41b0-a89e-f24c72174927","resolution":{"observed_at":"2026-08-07T13:17:07.764164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.507853Z","title":"Minimax weight and q-function learning for off-policy evaluation","venue":null,"work_id":"fd23d81b-7c21-48b2-a130-3f0b976a6e54","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.160195Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:93b355a6477456efc6bd1199102831523b3f1567f88b5857a513d6bddf2cf17e","observation_id":"95427da5-953e-4828-a1a3-9afece42be71","resolution":{"observed_at":"2026-08-07T13:17:07.582206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-06T02:47:43.502360Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-07T13:16:59.244313Z","title":"A review of off-policy evaluation in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.244313Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:f8f5689f3bbfa553baeeca9ca124333363fd32991079e8c61dc33c29b6271ad4","observation_id":"545f29b9-a6c7-4efa-b8dc-a8ed35540f44","resolution":{"observed_at":"2026-08-07T13:16:59.244313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.321616Z","title":"Future-dependent value-based off-policy evaluation in pomdps","venue":null,"work_id":"9621d807-ca02-4448-8e8a-df8b5dc8b7e6","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.334783Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:7fff9cfc6032ada9293cf157924b606ab4a9041e61ee0b24732cde1bb29669fc","observation_id":"4faaad34-d831-47bf-9316-24161d54223a","resolution":{"observed_at":"2026-08-07T13:17:07.402734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.124501Z","title":"W., Wellner, J","venue":null,"work_id":"e3523efb-221b-446d-9a31-721820ccec54","year":1996},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.448099Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:c494906e881861eec4e120c6444b124d129a411051e99fd0f90e8b864075a30c","observation_id":"dbca4510-59cb-4e97-9bcb-3d4bd89e501e","resolution":{"observed_at":"2026-08-07T13:17:07.227633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.936038Z","title":"Safe exploration for efficient policy evaluation and comparison","venue":null,"work_id":"2220bea1-dc68-4717-8e57-8a1d7198481f","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.535998Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:5b12cb310c9e36148f515ca4dd82b8184979a9090eccc8c652c5a1983a78bc66","observation_id":"bce7b07e-cbc8-4d16-b354-076b5e4193d5","resolution":{"observed_at":"2026-08-07T13:17:07.029178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15448","last_updated":"2026-06-02T22:28:41Z","snapshot_observed_at":"2026-07-06T13:58:14.551432Z","submitted_at":"2022-09-29T16:03:07Z","title":"Blessing from Human-AI Interaction: Super Reinforcement Learning in Confounded Environments","version":3},"cited_work":{"arxiv_id":"2209.15448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15448","snapshot_observed_at":"2026-08-07T13:17:02.610605Z","title":"Blessing from Human-AI Interaction: Super Reinforcement Learning in Confounded Environments","venue":"cs.LG","work_id":"f52289fd-1207-44fa-8c8c-c0d52adc6b26","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.636730Z"},"links":{"cited_paper":"/paper/2209.15448","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:081bbaca1bc2af89ccaedd58ed3c720d467c8fa7273a2907ec0102908171416f","observation_id":"a245a698-85c7-4393-ba08-1b02e7f94aea","resolution":{"observed_at":"2026-08-07T13:17:02.769580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.769854Z","title":null,"venue":null,"work_id":"88a52dce-7569-4230-a9b2-f9e1979d62b6","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.714007Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:19cf3973e0a93eae656317629bc5d32913cde125844ba1e2a6bc55868986ba7c","observation_id":"323967c1-c2f2-4265-87d9-3bc98a27f1c8","resolution":{"observed_at":"2026-08-07T13:17:06.847343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.592794Z","title":"Off-policy evaluation for tabular reinforcement learning with synthetic trajectories","venue":null,"work_id":"0dd1f1ee-8146-4b27-8aca-9904ab21c65b","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.793756Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:67cf64080d548fdbee8bd061f8307debfe58bfa5e8791e5e1ed2805ab1865abe","observation_id":"e4fc61c2-0fef-43a3-9468-12ebcf38ec60","resolution":{"observed_at":"2026-08-07T13:17:06.682959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.419430Z","title":"Unraveling the interplay between carryover effects and reward autocorrelations in switchback experiments","venue":null,"work_id":"c25e4b94-57a2-4878-b72b-3b984fd3bc91","year":2025},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.899396Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0bea5c0a6b132b35c33a845c188c849a2658786f4c9e3188dbcf9424856b29aa","observation_id":"563ceaa3-3eff-4226-94b7-4f6ddc600d0b","resolution":{"observed_at":"2026-08-07T13:17:06.487321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.224255Z","title":"Semiparametrically efficient off-policy evaluation in linear markov decision processes","venue":null,"work_id":"1b104e2d-2420-40eb-a0fb-5445bc77f5da","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.966690Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:9003506f42f7548d9ed5eeb12452a5434fcd99f5d82ad4337c1e2f552756d80b","observation_id":"babb5910-858b-4ed3-8b50-cc5542ed781b","resolution":{"observed_at":"2026-08-07T13:17:06.298936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.040614Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginalized importance sampling","venue":null,"work_id":"4c3d85ba-af98-43c2-8c43-7959bce02bdd","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.089605Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:14d0adf668057765dda193b1cb25fdbd235f7633e6bb24c30a0ceb0763aa988c","observation_id":"ffa3eb27-0ac8-42a5-a7a2-7949cdab0a73","resolution":{"observed_at":"2026-08-07T13:17:06.117651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.885085Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginalized importance sampling","venue":null,"work_id":"817182bc-fc9f-43cc-83c6-4decb1f6e70c","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.188458Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0e323aef2eed0d855947fe34f9541089f85a6feb546015867b0b4a2c7585e8d4","observation_id":"748abfb2-46a1-4789-b90b-a28ee93d0e2f","resolution":{"observed_at":"2026-08-07T13:17:05.956955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14466","last_updated":"2022-12-29T22:01:43Z","snapshot_observed_at":"2026-07-06T14:35:57.506538Z","submitted_at":"2022-12-29T22:01:43Z","title":"Quantile Off-Policy Evaluation via Deep Conditional Generative Learning","version":1},"cited_work":{"arxiv_id":"2212.14466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.14466","snapshot_observed_at":"2026-08-07T13:17:02.159050Z","title":"Quantile Off-Policy Evaluation via Deep Conditional Generative Learning","venue":"stat.ML","work_id":"7d6f94ae-9ee2-461c-954c-33f1a4dc8a3a","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.283152Z"},"links":{"cited_paper":"/paper/2212.14466","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e2cd9512cb821b7e20db3c2b569f7f4bf362ce84ea370086fc35e773c3a410f2","observation_id":"70ddb5a8-7bf2-4b41-83e2-ba540f4ed7b1","resolution":{"observed_at":"2026-08-07T13:17:02.401023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:00.380335Z","title":"An instrumental variable approach to confounded off-policy evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.380335Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:ce30923d4950d54ce6c585ca218a9f6fba3db3916664bf6429825beb1c244cf4","observation_id":"6de15f68-f83f-4b87-b49d-e48db67e2cf9","resolution":{"observed_at":"2026-08-07T13:17:00.380335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.727411Z","title":"and Wang, Y.-X","venue":null,"work_id":"e216efb8-aa39-4652-b72f-2ce05ee55aa7","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.494044Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:f96b3d003f70a08f4099ce67c2c5270d4863cbbfa16b6700d95112db47037838","observation_id":"84acc115-2bbd-4e54-8447-7ca1fb3ddd45","resolution":{"observed_at":"2026-08-07T13:17:05.792318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.584394Z","title":"Two-way deconfounder for off-policy evaluation in causal reinforcement learning","venue":null,"work_id":"1ab51eed-4a5f-4d62-8823-f244bd9929ac","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.581039Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:c3ac36cbd64dadafd99911c3db65b1201d885a9133ec0b96a343cf3dc8b1d589","observation_id":"e0498785-3fb3-4552-984a-f41cacf3261e","resolution":{"observed_at":"2026-08-07T13:17:05.635897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.435009Z","title":"A., Laber, E","venue":null,"work_id":"8ede70e2-9e4c-4515-a625-2509c87fb692","year":2012},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.642581Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:bf40801a398da0cdf25aad04fce73781103fbe97e8ae105ea1ae8d094f6274d2","observation_id":"9856e75b-2403-45c1-9963-e03bb168f867","resolution":{"observed_at":"2026-08-07T13:17:05.492543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.292196Z","title":"A., Laber, E","venue":null,"work_id":"17991146-c45c-4a85-bd77-3b7e362adbb3","year":2013},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.743625Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a29cfafa6417bd002ba76b2ad73da1e06ee78916e552454c2ec49744bcf4829b","observation_id":"aff6e40f-7662-485f-bf4f-6aecd7d41bad","resolution":{"observed_at":"2026-08-07T13:17:05.360563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.159835Z","title":"and Zhang, Y","venue":null,"work_id":"bc26d8a8-05a4-47d2-bcb3-41169abf6f6b","year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.837982Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:98674d5383f2ec7d1452584411bf27a64aea9a714345d1dee822a3b9499867a5","observation_id":"091369b4-6ed4-49e7-9e1b-bbe140f8acdd","resolution":{"observed_at":"2026-08-07T13:17:05.217784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.003193Z","title":"B., and Kosorok, M","venue":null,"work_id":"5312e2f7-47f8-4de2-89e0-67c8bf78f4d7","year":2015},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.918164Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:c9e78350011afa90949d46703543d99b203c904b066ab33414a14ba337be18b0","observation_id":"817f2570-b3f1-411c-8418-e5bb063fee49","resolution":{"observed_at":"2026-08-07T13:17:05.066644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13278","last_updated":"2023-10-02T00:41:01Z","snapshot_observed_at":"2026-08-06T18:52:36.360990Z","submitted_at":"2023-09-23T06:35:44Z","title":"Distributional Shift-Aware Off-Policy Interval Estimation: A Unified Error Quantification Framework","version":2},"cited_work":{"arxiv_id":"2309.13278","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13278","snapshot_observed_at":"2026-08-07T13:17:01.406411Z","title":"Distributional Shift-Aware Off-Policy Interval Estimation: A Unified Error Quantification Framework","venue":"stat.ML","work_id":"741b4bc2-8f83-44df-bfa1-bad18820fd54","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.981742Z"},"links":{"cited_paper":"/paper/2309.13278","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:360fa89bfedd4a57298d03b870cbe87ac953feaad2fa511c26220804085e74c6","observation_id":"de491975-afd8-4969-9253-61c05ba1bdab","resolution":{"observed_at":"2026-08-07T13:17:01.728469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:04.835899Z","title":"Robust offline reinforcement learning with heavy-tailed rewards","venue":null,"work_id":"6892765e-6b14-4927-8066-f126df303a58","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:01.051859Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:f60dab6fb76382d6cf35ec6426d1ddd4bc3615c7d2a5f6520ab26d106000b07a","observation_id":"8c1e2da9-074b-421d-9278-2c4e3909cf93","resolution":{"observed_at":"2026-08-07T13:17:04.924461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:01.124208Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:01.124208Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:66d6112dd490c52b26e9d28b0e5ef06832f0d707a274592b646b33a7996a7da4","observation_id":"34152c82-94af-4f4e-a037-fa18debd6725","resolution":{"observed_at":"2026-08-07T13:17:01.124208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T07:58:26.228808Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":7,"verified_fuzzy":50},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 0 inbound Pith citation observations for arXiv:2505.22492."}