{"as_of":"2026-08-17T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07be292581ed072ae09e75fc379aa62375657795d3fb1616162c689dfd340173","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:46:30.168252Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.08526/citation-record","integrity":"/paper/1908.08526/integrity","json":"/paper/1908.08526/citation-record.json","paper":"/paper/1908.08526"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.303270Z","title":"Ai and X","venue":null,"work_id":"5c05a712-155b-41ee-82c9-f617f31737c8","year":2003},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.634294Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:b7187938560e4c2b0162d58014fce3d2e44f5fa3025f4051dcb83af3a7ac254b","observation_id":"2f7b9a31-3e26-4e61-97aa-6095eeb23fe4","resolution":{"observed_at":"2026-08-14T11:46:32.310499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.259319Z","title":"Ai and X","venue":null,"work_id":"a1e98abd-e9b2-444e-89e4-d50fec94a0ad","year":2012},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.641706Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:04a531e7a97eb73130cbd58d017681f3bf188451dd701c9e9ef011e09dd81142","observation_id":"6a09b9d4-0a22-46dc-b54f-f4599ea5e1dc","resolution":{"observed_at":"2026-08-14T11:46:32.273051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.219513Z","title":"Antos, C","venue":null,"work_id":"0b19b0a7-7789-40d0-8f3d-f79370091b9f","year":2008},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.648353Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:614003fadafb82a895cf353d2963d1e458c21d775af9efc26f931809f8f884b1","observation_id":"9fa8affe-7a93-470e-9298-b2c917d49aa1","resolution":{"observed_at":"2026-08-14T11:46:32.232092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.173731Z","title":null,"venue":null,"work_id":"ca269bd8-70ea-4202-8b9d-3e29a4ce46de","year":2005},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.656662Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:0d1e50613b5eae1aaf1c9b26e4c4b261d18afe90620b80a15fc624bce3f76a9b","observation_id":"d818f678-21e1-4dc0-b942-8fb649b593cd","resolution":{"observed_at":"2026-08-14T11:46:32.190388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.147163Z","title":"Benkeser and M","venue":null,"work_id":"d6c83409-b42a-44a1-93df-ec70ecc15dca","year":2016},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.662248Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:5ef26f1aa85e21a54f438b4ad90ca1ee92c2760e7ed1d0a5a67b04f2d5b93422","observation_id":"d6edfed1-f4db-4313-b3e2-5fcfc0cbef8f","resolution":{"observed_at":"2026-08-14T11:46:32.154243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.109704Z","title":null,"venue":null,"work_id":"4a28f12f-12cd-4b65-aab9-8e613264e654","year":2012},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.668735Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:c2a3c4b1502d548ad26c2462b610cb275339cd232e5e3354bbbb5a19e0ad12c9","observation_id":"09e5b3f6-384d-40a6-96fc-8ccab2344dc3","resolution":{"observed_at":"2026-08-14T11:46:32.120086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.076993Z","title":"Bibaut, I","venue":null,"work_id":"a5713dd9-f843-43d8-bdd3-207b4a636d36","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.682231Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:55f488235d6ea9dc414cf3b966df82ecc5088250b388d071b0abbfa80708e3fc","observation_id":"de1af119-467d-4b1a-a29c-254f140b8e54","resolution":{"observed_at":"2026-08-14T11:46:32.088567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09244","last_updated":"2019-08-23T17:50:22Z","snapshot_observed_at":"2026-08-14T16:03:47.479919Z","submitted_at":"2019-07-22T11:36:32Z","title":"Fast rates for empirical risk minimization over c\\`adl\\`ag functions with bounded sectional variation norm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.09244","snapshot_observed_at":"2026-08-14T11:46:29.690268Z","title":null,"venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.690268Z"},"links":{"cited_paper":"/paper/1907.09244","citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:7a6b21c6782df687c89a9c13208827a99ee5404df85daf1cea2f107d1128797b","observation_id":"1e23951c-9ce7-4762-8e03-a682dda75c17","resolution":{"observed_at":"2026-08-14T11:46:29.690268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:29.700225Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.700225Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:4cc23e13e5514f144e3f822f0c4872bb394101dc5db065a5890ee2dd9bdd137f","observation_id":"a43cee4a-eafd-4766-9a3c-8e4461c1c3c6","resolution":{"observed_at":"2026-08-14T11:46:29.700225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:32.017543Z","title":null,"venue":null,"work_id":"ef367520-a478-420e-a61a-e0c6df8c7590","year":2012},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.708272Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:7c46f31335bcb2750e4b5f17089e7920c063ba33ea48035aef32242905ae6488","observation_id":"4dceaf47-f150-4468-b2bd-37098574e674","resolution":{"observed_at":"2026-08-14T11:46:32.030080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-14T11:46:29.713760Z","title":"Brockman, V","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.713760Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:697728bff1aa2a39a87400f11a350738bfd02ca724ec014b913551c7aa166d8d","observation_id":"4e9e4388-96a0-43dd-98b3-2b0404f82f21","resolution":{"observed_at":"2026-08-14T11:46:29.713760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.984702Z","title":"Chakraborty and E","venue":null,"work_id":"37ba15d1-909c-46b7-8900-7fad239556e9","year":2013},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.720851Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:87e288f146ff0158d72a604f4540a55f26ca6587a28ff420d2eeb156a71854e2","observation_id":"6c60ff96-8cce-4aa1-b15f-e891c1d266fa","resolution":{"observed_at":"2026-08-14T11:46:31.993407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.960366Z","title":"Chamberlain","venue":null,"work_id":"187bc578-7118-4575-bcb1-e8254841834c","year":1992},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.727579Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:4f9bcdafcc9a16c8346f976301afadfd8a83a5a1564258ffee8da2ba67acea08","observation_id":"9a64125f-fc43-4087-a8be-7c5722234d21","resolution":{"observed_at":"2026-08-14T11:46:31.967525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.939663Z","title":null,"venue":null,"work_id":"debfd1d6-4e14-4ba9-aba4-d9f2d3482bdc","year":2007},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.733332Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:14e866c029fc448bb4c613742ad4542049d7e951a9b81ad24c38c9c330189cb8","observation_id":"9fab8462-5abe-4776-979a-edd1d53d53cb","resolution":{"observed_at":"2026-08-14T11:46:31.946969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.908126Z","title":"Chernozhukov, D","venue":null,"work_id":"ceb060a8-4745-4ee2-8ba3-201e13fcb4e9","year":2018},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.739432Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:4ff19e16571b83a5145df3f1d3fa9409f252706acd0c4478282c7374c4ab3d52","observation_id":"dc187219-a481-4ab6-8918-8d4fe65e1d18","resolution":{"observed_at":"2026-08-14T11:46:31.922449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.866161Z","title":null,"venue":null,"work_id":"41d27254-b4c3-452f-bc8f-6bc74dec5bd3","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.744066Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:a2c22941720b45fe0e93e4a9f2123f26e0e934741f7bdfe66000d54f68ddab89","observation_id":"f1477ac4-7b3e-43c7-9e51-78000f8b228f","resolution":{"observed_at":"2026-08-14T11:46:31.874087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.837413Z","title":"Dudik, D","venue":null,"work_id":"b798104c-766d-475a-8b74-5faaa7cef6c7","year":2014},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.751133Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:1ccb095c518d00e73fcb52572552ef6252881aed4b725b8d54254a812d976d84","observation_id":"f048094e-e66a-4e83-9a46-670416b3cf26","resolution":{"observed_at":"2026-08-14T11:46:31.843720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.808121Z","title":"Ertefaie and R","venue":null,"work_id":"a70808aa-748d-4c16-9bf1-6dd191d06274","year":2018},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.756664Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:52cef9948465ffc6bf880d42b712b2f445390002d33650c138f1bc798bb84d81","observation_id":"d4341ded-05a6-40df-9260-59191525b859","resolution":{"observed_at":"2026-08-14T11:46:31.818799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.784985Z","title":"Farajtabar, Y","venue":null,"work_id":"c9e66c0a-6134-4a61-9574-623458b9c2f4","year":2018},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.763061Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:95c5a2a0979f935ab576a2d2c5a82c003df84f9f6cb21e9caf2fbef4aa68af5f","observation_id":"e8741784-62bd-4a8e-ab96-26a3abe57435","resolution":{"observed_at":"2026-08-14T11:46:31.790363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.764853Z","title":"Gottesman, F","venue":null,"work_id":"3c5066be-429a-48f1-996f-8770f7fc756c","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.768468Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:dfb7fe09a1e51579ee4ada6532de933c874e0640765c72e858c1959e139e4198","observation_id":"187b1056-ac8d-418a-8ffe-06d61e441410","resolution":{"observed_at":"2026-08-14T11:46:31.771074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.742394Z","title":"Gy \\\"o rfi, M","venue":null,"work_id":"c5522fb0-437f-4a46-a6ea-a7ac43fdd76a","year":2006},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.779224Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:1a38aa2bde3c3e27620e12ab92b56bc345537775adb3f5381888ff551d008399","observation_id":"7188bc26-2d3a-4d1c-aee4-7ba21dd13e0c","resolution":{"observed_at":"2026-08-14T11:46:31.747914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.717255Z","title":null,"venue":null,"work_id":"3e0c6987-f525-4c2f-a04a-c6ae77c5b568","year":1997},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.784699Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:17cf04694371d2fee4fb31481f58530c790ecd1736e58899c2b829f18275c45f","observation_id":"27e3deb6-450b-44d1-be84-81f952661e85","resolution":{"observed_at":"2026-08-14T11:46:31.724609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.695953Z","title":null,"venue":null,"work_id":"62f16def-fe2b-4c8f-8891-bbbaa8fd0c94","year":1998},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.791151Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:755ed7019cad3da7390f2e8b8e09a594a9c4ddafa14d223fd50fca59eaf08f50","observation_id":"96fac50b-3a5c-45d8-83ac-e8a784e66047","resolution":{"observed_at":"2026-08-14T11:46:31.701751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.672439Z","title":null,"venue":null,"work_id":"7a937695-4645-4fb9-94aa-9ca762ef996a","year":1982},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.797140Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:b72347efdca3cde7f0a875b810ade795bfd4844eef805beb83d4fecd8e1afcca","observation_id":"bc4b7f22-3f27-4757-b432-6e2ae0f6a4f5","resolution":{"observed_at":"2026-08-14T11:46:31.681744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.651509Z","title":null,"venue":null,"work_id":"c3b6a3c0-f20f-4cba-81cd-713b7ea4d24f","year":1996},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.805065Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:75a8204eca79f72fbc3eaba000d843031334c8182118a4c3ee378e672bb6c2a1","observation_id":"40afc250-0db6-4f50-8d13-411bf036bc69","resolution":{"observed_at":"2026-08-14T11:46:31.658624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.631045Z","title":"Hernan and J","venue":null,"work_id":"1dd8857d-95fb-4029-9766-3bfc9a7e038f","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.812436Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:b004c89f5bc8b42728ba4f6531453ab443b3991549295902200b1c6ddd97e559","observation_id":"daa26224-7df5-44e2-a5a5-a44414a2197e","resolution":{"observed_at":"2026-08-14T11:46:31.637722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.572151Z","title":"Hirano, G","venue":null,"work_id":"094c15ac-d63a-41f0-9c71-8c1c5c38f728","year":2003},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.818987Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:c6ade43ba70df1612ae8fbf08ec62acb6991364a59ca5fb3a291a8b3aff73121","observation_id":"582a21ef-731e-4fcd-855a-f837ff193c4e","resolution":{"observed_at":"2026-08-14T11:46:31.588084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04474","last_updated":"2018-07-07T05:24:42Z","snapshot_observed_at":"2026-08-14T19:46:31.270786Z","submitted_at":"2018-02-13T06:24:27Z","title":"Deep Neural Networks Learn Non-Smooth Functions Effectively","version":2},"cited_work":{"arxiv_id":"1802.04474","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.04474","snapshot_observed_at":"2026-08-14T11:46:30.367762Z","title":"Deep Neural Networks Learn Non-Smooth Functions Effectively","venue":"stat.ML","work_id":"07cd214d-f4f1-400b-af20-c506452dfd53","year":2018},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.826640Z"},"links":{"cited_paper":"/paper/1802.04474","citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:212d6a07de26ddfd96141cf7e4d89a1124ed055dcee31464ea3b3caf56356c0a","observation_id":"e5cfc05c-9586-4051-ba4f-7268017bb553","resolution":{"observed_at":"2026-08-14T11:46:30.378997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.552982Z","title":"Jiang and L","venue":null,"work_id":"4132519b-2f14-41eb-8af6-7829db1dd1fb","year":2016},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.832031Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:556e0aaee2826c7d392d528e34859e080dbe96920878987ef815b589cecdd776","observation_id":"e833b080-1600-4f94-a90c-6b76babb06d3","resolution":{"observed_at":"2026-08-14T11:46:31.560180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.520807Z","title":"Kallus and M","venue":null,"work_id":"3f163363-fb43-48e8-87ea-be9f5580b5b7","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.839456Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:115a22ba59dfe65bda2d7f3948ee1bf325ba608c41c5ef99c14e6371408397ac","observation_id":"4130b4d5-b87b-4fce-a4c4-8a8211510a98","resolution":{"observed_at":"2026-08-14T11:46:31.534839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.03719","last_updated":"2019-06-18T00:18:22Z","snapshot_observed_at":"2026-08-14T17:32:04.825964Z","submitted_at":"2019-01-11T19:22:48Z","title":"Non-Parametric Inference Adaptive to Intrinsic Dimension","version":3},"cited_work":{"arxiv_id":"1901.03719","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.03719","snapshot_observed_at":"2026-08-14T11:46:30.326517Z","title":"Non-Parametric Inference Adaptive to Intrinsic Dimension","venue":"cs.LG","work_id":"066b9592-6978-4a32-9e60-bc0dcd1d06fd","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.845940Z"},"links":{"cited_paper":"/paper/1901.03719","citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:3c852e3004a8b6dd955d218519c4573007fca1a9a55e89d35f4f996b6ea37f21","observation_id":"2784b18d-a65b-4730-9624-81580d3ef43e","resolution":{"observed_at":"2026-08-14T11:46:30.339063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.495728Z","title":null,"venue":null,"work_id":"ad06d072-200d-40a7-ba52-91dae0dbea2f","year":1987},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.852119Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:eb619fc7a1ea402df447d6c3cf3f4d2d3d69634b226f5216047a32cf363d587d","observation_id":"d974909d-c01f-419c-a4c3-b1691fdb1f99","resolution":{"observed_at":"2026-08-14T11:46:31.501943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.459148Z","title":null,"venue":null,"work_id":"7c0ac93f-1bc0-4406-a7fc-95061834f64c","year":2008},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.857083Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:748ba3747966673954f9087f1dfef8f15dd9007f89d0cb4bf58463ef6e81a29f","observation_id":"7a009ad2-ec69-4248-8704-ab35dee85572","resolution":{"observed_at":"2026-08-14T11:46:31.465329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.422854Z","title":"Lagoudakis and R","venue":null,"work_id":"f61aa11a-4e19-4e33-bcb3-82678e3e8852","year":2004},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.862257Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:50dcceb914020aa83c2396eba9bb04c996a8897606f5904ba5cf85b874e310a0","observation_id":"d225f321-f385-411e-a58b-87a7943f1e5c","resolution":{"observed_at":"2026-08-14T11:46:31.430843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.390722Z","title":null,"venue":null,"work_id":"b7737290-a765-4de6-b3de-dee92677a08e","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.873067Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:19059b2665e26a8ab51d8f40e186f77e1231e6c56239a8ade441c4be1e1f664d","observation_id":"dd1a6b8b-b1df-4d79-9ef3-40a075870779","resolution":{"observed_at":"2026-08-14T11:46:31.397232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.370438Z","title":null,"venue":null,"work_id":"41e6abfd-4488-4388-b092-1700f6aeea71","year":2015},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.878243Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:5623d94a26e75d6ff73b1be665785c9eec25b4565b56ba0ed3a0e9b1c015e22b","observation_id":"c809529c-5f0f-4cc5-9162-a5d15a9a7ab7","resolution":{"observed_at":"2026-08-14T11:46:31.375862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.345457Z","title":"Li and J","venue":null,"work_id":"9a1dd543-9eda-4e5d-9e1a-43ab12fcbf67","year":2007},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.887722Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:9b19dd41864d82df2a84a196cb027e7b8578862767d49cd8d224c8eddb903f3e","observation_id":"2b630a9a-167b-4935-acd9-17134ff9891c","resolution":{"observed_at":"2026-08-14T11:46:31.354132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.313957Z","title":null,"venue":null,"work_id":"d0669086-afaf-4e75-8c2a-6463dc21a99e","year":2018},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.894740Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:a80cf48e9f67e47c7c3fc04b8145a5945d3cb5306e230b458813f6dc5ab2f005","observation_id":"bfb89cd7-e8a2-4360-bac8-2c7669c1f636","resolution":{"observed_at":"2026-08-14T11:46:31.326902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.284279Z","title":null,"venue":null,"work_id":"75d1035b-bd9c-49d4-b3e2-4bbcd5edf68e","year":2018},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.903268Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:071aef5fabd6ad49f3839a47663fe048da7869ee70263be843a67acd51efe134","observation_id":"6d863ec6-1291-4917-a0a0-a21422839f2b","resolution":{"observed_at":"2026-08-14T11:46:31.291614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.258574Z","title":null,"venue":null,"work_id":"96be251b-47c3-4585-92a3-4e11aaedd9f0","year":2014},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.911261Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:ff55926009335fd5d4036640971a226cece69269ee9396987b37ad8aae1e1f6f","observation_id":"f89ec68f-efb6-4d90-a9ee-d020a1f21e7e","resolution":{"observed_at":"2026-08-14T11:46:31.265746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.235189Z","title":"Mandel, Y","venue":null,"work_id":"ad45570c-68d5-4c37-8e3c-f840c1df03ed","year":2014},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.916643Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:52eda461b6c53f638520062a4c780ffe201b0d2ebf19041d887806d3c3624e9f","observation_id":"a33cf5bf-3eee-4da9-adc9-09fc9f8b6d5a","resolution":{"observed_at":"2026-08-14T11:46:31.240629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.207185Z","title":"Mannor, D","venue":null,"work_id":"99a715a9-185c-4eb7-9b3e-7cb0140da4d5","year":2007},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.927349Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:008b92c2bcb6876d59d022ede90045def97cb2e0b28b7255d278150eb9588583","observation_id":"e2f2b559-f3fc-4543-b051-9461d4f8e323","resolution":{"observed_at":"2026-08-14T11:46:31.214132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.183587Z","title":"Munos, T","venue":null,"work_id":"de3944bd-997b-48b1-a017-ad6f12fffc7e","year":2016},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.933559Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:ec4b6cbe0da813e5aea11cb57dca76f9fe50078b8db058f5eda703a41f119789","observation_id":"d8b0a424-78a6-47d9-91d7-319aa22a519c","resolution":{"observed_at":"2026-08-14T11:46:31.192089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.155735Z","title":null,"venue":null,"work_id":"f5b87bd7-b665-4964-b841-4d8da0feb263","year":2003},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.940144Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:92c8378d7981116141a8e24e5cf521bca259b332c9f544c7cc904d52f48be706","observation_id":"822b46da-14c6-4ba8-bfef-6d0673854268","resolution":{"observed_at":"2026-08-14T11:46:31.166768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.119115Z","title":null,"venue":null,"work_id":"497298c1-aea3-45d0-9a88-eadac1e27d76","year":2001},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.950509Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:dd55506396761dbddeef2170685f6e9b6ab438b9833ab3aba32463f6528ff4c3","observation_id":"3c527b1f-0f8d-4bc6-9832-a66756345532","resolution":{"observed_at":"2026-08-14T11:46:31.129731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.088360Z","title":null,"venue":null,"work_id":"ca689c32-64ff-4f14-87da-ff14e9f35e81","year":1994},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.958145Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:f147c5e78d36d391561a8fa37fce92684e11e54ef8dafc80abdfc364cacc39d5","observation_id":"20279ca8-88b9-4e63-b109-6c0971aecc98","resolution":{"observed_at":"2026-08-14T11:46:31.095052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.060058Z","title":"Precup, R","venue":null,"work_id":"3bf650c7-b428-483d-825e-ebdcb10ce2a1","year":2000},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.965527Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:f2ead567d700f92d2154121095b29fce14eb8fc90f3c1cdf0e4d1c0cb7513b2e","observation_id":"51abad15-06c2-498f-9d52-25c699b96e12","resolution":{"observed_at":"2026-08-14T11:46:31.069128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:31.031141Z","title":"Rahimi and B","venue":null,"work_id":"6a963d8f-5e3a-4edc-a7b2-efd201ca1228","year":2008},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.973681Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:c33b1f061b204205e955c1eedfa09b11e68d7a9d00a760e514656697f222ea0b","observation_id":"4d4a39b5-8936-4af7-8593-97bd6094a46c","resolution":{"observed_at":"2026-08-14T11:46:31.040737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:29.978792Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.978792Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:3d16fcad1de6fddb853129ca0e58066aa0445fa1dceeb735b8ef9272e518c68f","observation_id":"a29adcc7-471b-4a9a-bd40-02b089af0ab7","resolution":{"observed_at":"2026-08-14T11:46:29.978792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.981789Z","title":null,"venue":null,"work_id":"9c11b7a1-a45c-4d1b-9f5b-21f90479fa97","year":2000},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.984207Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:a92dd9b28e6abdb123a0999085715e2a48e21eba8912d911c3954f10972bfb0e","observation_id":"c5474ff6-ed48-4ff7-9f19-a2047e5088a0","resolution":{"observed_at":"2026-08-14T11:46:30.988725Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.952480Z","title":null,"venue":null,"work_id":"4f6ab466-ba69-4417-aa74-70ae2693526d","year":2000},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:29.991655Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:4f388040c7c70c533649ababc52f9172891080515e2990fd907a5070fc06ca4e","observation_id":"3891080d-8386-47e1-9ee7-9440383b4ffa","resolution":{"observed_at":"2026-08-14T11:46:30.961020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.923829Z","title":"Rotnitzky and S","venue":null,"work_id":"7bc503fc-2f33-4137-9bb0-487374aa1262","year":2014},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.007990Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:ac4d9a85509bc67e3e6460c1963aa47202b7fe0efa1fcf37eef914472cb9d481","observation_id":"f35b1f7a-ee20-4320-a4bf-ebfc7c5a3e12","resolution":{"observed_at":"2026-08-14T11:46:30.932614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02556","last_updated":"2019-09-09T11:06:19Z","snapshot_observed_at":"2026-08-14T22:33:14.241672Z","submitted_at":"2015-09-08T20:59:05Z","title":"Identification, Doubly Robust Estimation, and Semiparametric Efficiency Theory of Nonignorable Missing Data With a Shadow Variable","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02556","snapshot_observed_at":"2026-08-14T11:46:30.017260Z","title":"Rotnitzky, E","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.017260Z"},"links":{"cited_paper":"/paper/1509.02556","citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:acb9bb68a876b9430fb964d395fa45a24b4917d2a55ee1317f7018382d0275c5","observation_id":"93237f4b-a33a-4e24-a832-e67a5bd7ced2","resolution":{"observed_at":"2026-08-14T11:46:30.017260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.899418Z","title":"Scharfstein, A","venue":null,"work_id":"2ad44e8a-9e0b-46d1-9e00-ae1a83671e79","year":1999},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.027133Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:f8adc150caffd7e712de709906c79d5d1ce5a55d13e4242ff0547c07610c75f8","observation_id":"57dc18f1-35d7-4f56-992e-64068604e7f5","resolution":{"observed_at":"2026-08-14T11:46:30.908750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.878574Z","title":null,"venue":null,"work_id":"3e22a6a2-db8d-4653-b31c-916961cbc5d4","year":1997},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.036300Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:0ba817baa1dd3c959ba753b897728c158097dc3c12ed3f3e2640a15c207e34d8","observation_id":"c5646464-6853-4f32-929c-2a9e204ae2e7","resolution":{"observed_at":"2026-08-14T11:46:30.886535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.855251Z","title":null,"venue":null,"work_id":"03a5988b-a725-4569-a195-d220775d65d6","year":1994},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.043767Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:43abac0c4156453661171ce8fe31481307a67899ad88cac20b4d1f804a1b1d72","observation_id":"fdf71f61-1d43-4320-ba9b-e839a7b4f1d0","resolution":{"observed_at":"2026-08-14T11:46:30.863362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.834153Z","title":null,"venue":null,"work_id":"97ee075d-752b-4641-b899-8e887953a994","year":2018},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.052525Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:d2ca1e88bce0dece84933dceddc6b135c04149c64296b5896b62e7dbdc30fb54","observation_id":"f07166fe-6c58-4096-a7d9-e03af9c18acb","resolution":{"observed_at":"2026-08-14T11:46:30.840593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.815639Z","title":"Swaminathan and T","venue":null,"work_id":"36bf0d8f-cd74-4d2d-b799-3d6d64ba730b","year":2015},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.059703Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:d0906e7c9368abf144a2a9232edd1c3d4d5a30019b2a5b392162981e645389db","observation_id":"a851e44f-fed0-4bbb-8988-eee8049152d0","resolution":{"observed_at":"2026-08-14T11:46:30.822877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.793175Z","title":"Thomas and E","venue":null,"work_id":"3c709cc2-27de-467c-9346-d9deccb75106","year":2016},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.067720Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:0a820bac32c21ee014d8434ebc390e0a9bbc02589091d1c6be453c2904076d46","observation_id":"1abeb396-058d-45fe-abe3-bc2e6bc0f24f","resolution":{"observed_at":"2026-08-14T11:46:30.800713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.769301Z","title":"Tripathi","venue":null,"work_id":"5ba6dd9d-b474-4351-98f8-20e9d1e44880","year":1999},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.074811Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:171d57017f56ea43f252e6342a7ffa29e0ab9a0775e45aa268e2481d28eb0c7c","observation_id":"ea5317c0-baf0-426e-9596-c2fd244d828a","resolution":{"observed_at":"2026-08-14T11:46:30.775764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.737871Z","title":null,"venue":null,"work_id":"456ad76c-5ee4-4332-849c-a20cbfc9ba60","year":2006},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.080935Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:25b7a89e4e246b9dced3a3a935757a7c32e372cd245265a6c1c001f6e57cc48c","observation_id":"b58a750b-1315-4ed8-b028-2bef40a88917","resolution":{"observed_at":"2026-08-14T11:46:30.747367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.698825Z","title":null,"venue":null,"work_id":"df83ab86-c2ad-46ac-9fbc-d0eb8a1de368","year":2003},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.086598Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:11ce137f050a9d3b9610174bf0f2cf3a27d22bcc4a0bd02595f47f1a7b822f0b","observation_id":"50296aed-8de8-4c85-976e-022a1cdb4864","resolution":{"observed_at":"2026-08-14T11:46:30.711610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.676732Z","title":null,"venue":null,"work_id":"bfe6acf4-5557-49a0-9292-eb1eb6c36e22","year":1991},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.097210Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:14d6046a25d9f3661271f6fe29fc9ee940d7894cd4372f7fc921ad607c8ba666","observation_id":"c7eb9fa1-801b-49f8-9920-8861b86df38e","resolution":{"observed_at":"2026-08-14T11:46:30.683598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.659847Z","title":null,"venue":null,"work_id":"1e9739f8-9dd8-4b48-8b4a-5310e339a8e3","year":1998},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.104286Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:5c7bc2685876edd51f66dddbeecab1999049137fa4d7c8fad8fc79ef23ec5fd2","observation_id":"f816fdf0-9662-48fd-9c08-fb500a359bec","resolution":{"observed_at":"2026-08-14T11:46:30.664588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.640782Z","title":null,"venue":null,"work_id":"089a8037-45d5-46ec-8b5e-317727f1a640","year":2002},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.112904Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:475015cad618634792a385bc781d8391637773a56198241c4f67d1f262a686e9","observation_id":"8a76e8bd-8928-4624-add7-95d5f7079e89","resolution":{"observed_at":"2026-08-14T11:46:30.646811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.617144Z","title":"Vermeulen","venue":null,"work_id":"6b697016-235f-46c5-a472-946ba4b87453","year":2010},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.119558Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:17284a24548a7e1eb101705329958d9cc466af788b24d1faf7093bd9baa6fffc","observation_id":"686ae564-f31c-4a78-85a4-c6b9f51b6a91","resolution":{"observed_at":"2026-08-14T11:46:30.622835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.06388","last_updated":"2016-04-30T22:32:52Z","snapshot_observed_at":"2026-08-14T22:55:25.324416Z","submitted_at":"2015-03-22T06:07:14Z","title":"Adaptive Concentration of Regression Trees, with Application to Random Forests","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.06388","snapshot_observed_at":"2026-08-14T11:46:30.130845Z","title":"Wager and G","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.130845Z"},"links":{"cited_paper":"/paper/1503.06388","citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:1bcceef047bce6f652f8ba21c07fa8a6e86656d1467bc361a4ae7dc6b5332941","observation_id":"1cbdc28f-9c5a-49e4-8aa7-5769a7bb7978","resolution":{"observed_at":"2026-08-14T11:46:30.130845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.584885Z","title":null,"venue":null,"work_id":"1747be44-858a-42bc-9702-be1a7918b9ac","year":2019},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.136827Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:5950b11f8e55cc3f57f2d0ce0df38f5d768dbc35757138a3d080389d6275a352","observation_id":"9341a610-d4e4-4f3a-8465-1a1099db1c87","resolution":{"observed_at":"2026-08-14T11:46:30.601862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.561400Z","title":"Yin and Y.-X","venue":null,"work_id":"53e832b3-be2e-4abc-81ec-ddbb62b60a68","year":2020},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.144544Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:914969b73e50907ce23840da3e411ace57ce071e6b7411faaa364c36882a41dc","observation_id":"ff344948-ef2b-4eac-a8dd-2c89ebf7e840","resolution":{"observed_at":"2026-08-14T11:46:30.569546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.527681Z","title":"Zhang, A","venue":null,"work_id":"b4b47919-e05f-4399-9b32-75b512642c7b","year":2013},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.161025Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:b3f8689dcd8c7ebcc04bd86b6e030dbe6933457d40b0b04c1f520584a4875329","observation_id":"a34c62ce-fd75-4651-bb54-fd8f7ef4f919","resolution":{"observed_at":"2026-08-14T11:46:30.542262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:46:30.481394Z","title":"Zheng and M","venue":null,"work_id":"c85944aa-bd3b-4711-a77a-af7d614fd5ce","year":2011},"citing_paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-14T11:46:30.168252Z"},"links":{"citing_paper":"/paper/1908.08526"},"observation_digest":"sha256:bf6f623fd12b2f3e2994e1af7604446a652ce4d982775c71082763071e247510","observation_id":"36e41956-8ef9-4a85-84a7-a6e2bdd2c41c","resolution":{"observed_at":"2026-08-14T11:46:30.492426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08526","last_updated":"2020-06-05T09:58:10Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T22:20:41.635900Z","submitted_at":"2019-08-22T17:57:19Z","title":"Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:1908.08526."}