{"as_of":"2026-08-13T07:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:801fd01383f5152082179b26d8b1b7087a0e55a0caf50e042c7a0907e68ca243","coverage":[{"denominator":106,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:26:49.464366Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:36:27.422590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2412.05783","doi":"10.48550/arxiv.2412.05783","metadata_source":"pith","pith_arxiv_id":"2412.05783","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","venue":"cs.LG","work_id":"59e3efe6-62c7-4102-9c90-e558557ca8e2","year":2024},"citing_paper":{"arxiv_id":"2607.21090","last_updated":"2026-07-23T09:20:38Z","snapshot_observed_at":"2026-08-06T22:04:57.750051Z","submitted_at":"2026-07-23T09:20:38Z","title":"Training Large Language Models for Self-Explanation Faithfulness","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-01T08:36:27.422590Z"},"links":{"cited_paper":"/paper/2412.05783","citing_paper":"/paper/2607.21090"},"observation_digest":"sha256:ecd336510f9af98a28077bce61d6c9e7f97a2f23773038b1ced50b9a7d1786df","observation_id":"76ef2f32-1274-4e25-b5f0-bf677d993731","resolution":{"observed_at":"2026-08-01T08:38:36.968420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05783/citation-record","integrity":"/paper/2412.05783/integrity","json":"/paper/2412.05783/citation-record.json","paper":"/paper/2412.05783"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.013868Z","title":"Formulation and estimation of dynamic models using panel data","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.013868Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:f198ffa9a1caed50346e2fc15080865d6db7ef539c3fd82f2bf5350d1ef6c1f5","observation_id":"5cf9ca6b-303e-49b7-860a-b97f038ec39c","resolution":{"observed_at":"2026-08-11T20:26:49.013868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.019604Z","title":"Doubly robust identification for causal panel data models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.019604Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:bfd974003750d483f7088a6d6e807079a8c405ee45c5a83baddf4775cfe33a82","observation_id":"81eab347-b38c-4953-a397-f6fa7bbcb21d","resolution":{"observed_at":"2026-08-11T20:26:49.019604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.024472Z","title":"Design-based analysis in difference-in-differences settings with staggered adoption","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.024472Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:fee9d54fa0b7285389860d354b34ef13d0dc246726c1098fbf15fce814fd2425","observation_id":"d392ba94-52de-418b-9353-b0106c23bf1f","resolution":{"observed_at":"2026-08-11T20:26:49.024472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.029217Z","title":"Econometric analysis of panel data, volume 4","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.029217Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:3b89d0b649e1a06869c9dfcef70e43103b39f072041a690723bf8745e889acf0","observation_id":"a13dec1d-9588-44aa-bf28-610180a1d069","resolution":{"observed_at":"2026-08-11T20:26:49.029217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.033801Z","title":"Genetic risk profiles for cancer susceptibility and therapy response","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.033801Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:3eada87d50bdb76b3d446239f1bebf86654ba6cd83c9db6452cb54819e397fa1","observation_id":"856b2df3-9142-4198-a91c-0af226994e1d","resolution":{"observed_at":"2026-08-11T20:26:49.033801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.038799Z","title":"Proximal reinforcement learning: Efficient off-policy evaluation in partially observed markov decision processes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.038799Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:f5ed6913a14b33dc77dc95786994a555815144ad5a8c495e1fa1c669754fab4e","observation_id":"b4fc580b-0d56-486a-9196-350a637475a3","resolution":{"observed_at":"2026-08-11T20:26:49.038799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08719","last_updated":"2024-08-18T14:21:58Z","snapshot_observed_at":"2026-07-06T15:42:41.200399Z","submitted_at":"2023-06-14T19:48:30Z","title":"Off-policy Evaluation in Doubly Inhomogeneous Environments","version":4},"cited_work":{"arxiv_id":"2306.08719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.08719","snapshot_observed_at":"2026-08-11T20:26:50.163709Z","title":"Off-policy Evaluation in Doubly Inhomogeneous Environments","venue":"stat.ME","work_id":"8369ad55-e494-43ab-b5bd-869b2bec16cd","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.043818Z"},"links":{"cited_paper":"/paper/2306.08719","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:018a96e51202b700f3c738cd093417d6b90471aa759f06e72f1e7bc8c19da29a","observation_id":"2d2851fd-f9da-422f-a698-a9b11f3f2593","resolution":{"observed_at":"2026-08-11T20:26:50.168208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.048680Z","title":"Time series deconfounder: Estimating treatment effects over time in the presence of hidden confounders","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.048680Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ebd23915efa8423ff2014eded535b449703a5ec1d3cd0146eb6c872ff8f93143","observation_id":"e6aa3b11-ad83-48f3-aa5e-d6c55cdf5ca9","resolution":{"observed_at":"2026-08-11T20:26:49.048680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.052749Z","title":"Robust fitted-q-evaluation and iteration under sequentially exogenous unobserved confounders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.052749Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:f05ffad8153bf8583c9e8300dc7c61830a7d26c84d2769ea0cc4997f9068dc94","observation_id":"f3703407-ced8-4883-8a64-918f469106e4","resolution":{"observed_at":"2026-08-11T20:26:49.052749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.057216Z","title":"Treatment effects in interactive fixed effects models with a small number of time periods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.057216Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2418003075b35d73fc1b04dfa656195cc0df653fcec1b8e54a21103989071be8","observation_id":"2f731838-1fa3-45b9-bd8d-fc1dcab8f1d9","resolution":{"observed_at":"2026-08-11T20:26:49.057216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.061405Z","title":"Statistical inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.061405Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:bfb05b5b5465a6e296beae6dbb3e01e51cc39ba98a592fa0a136f78344c6f518","observation_id":"64d47dda-039d-4779-9afd-7c65d9605d74","resolution":{"observed_at":"2026-08-11T20:26:49.061405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.065314Z","title":"Universal off-policy evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.065314Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ef40d00f753649be5ca827cbb9ca5e2456210362437cce041b7540e32c1ba995","observation_id":"674bde1d-3223-409c-babe-49b6fe6a5f80","resolution":{"observed_at":"2026-08-11T20:26:49.065314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.069222Z","title":"Testing for the markov property in time series","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.069222Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:cb20c29fc1cbe06a139766ad6028c9b156e0bfad8495767bab9d27ca06173ed3","observation_id":"ea0ba1f1-cf76-4fa8-ad75-515556cd94b5","resolution":{"observed_at":"2026-08-11T20:26:49.069222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00360","last_updated":"2019-05-01T16:19:28Z","snapshot_observed_at":"2026-08-05T07:59:25.393101Z","submitted_at":"2019-05-01T16:19:28Z","title":"Information-Theoretic Considerations in Batch Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1905.00360","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.00360","snapshot_observed_at":"2026-08-11T20:26:50.063789Z","title":"Information-Theoretic Considerations in Batch Reinforcement Learning","venue":"cs.LG","work_id":"b0b5b3b7-40a2-4fdc-a67d-e9185adfc446","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.073582Z"},"links":{"cited_paper":"/paper/1905.00360","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:fa150b83ea64e25ec89b410cbfe3c593842d86a11088b8f377a39ac115488228","observation_id":"61ddd041-b55b-4d1e-932d-44105215db94","resolution":{"observed_at":"2026-08-11T20:26:50.069475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.078519Z","title":"On well-posedness and minimax optimal rates of nonparametric q-function estimation in off-policy evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.078519Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:9ecf57e0a3943cda5c13b572a2c0c3cfc872f77600506938dd9adce1af959b87","observation_id":"61dbe7c9-4d78-4c87-b6a3-b8ea0c5428b2","resolution":{"observed_at":"2026-08-11T20:26:49.078519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.083127Z","title":"On instrumental variable regression for deep offline policy evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.083127Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:0abc87019097031591470f4dbea00c13494d26916cd7bb63bb68a642de2c280f","observation_id":"79a87a3e-8b07-4c7e-9a83-f545bcf34291","resolution":{"observed_at":"2026-08-11T20:26:49.083127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.087629Z","title":"Double/debiased machine learning for treatment and structural parameters","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.087629Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:3fb5ecdd003c95b1a68a30538e92b864b3652d97d46c47b56bbba76ae8381188","observation_id":"cca7315a-4c7e-47dc-9384-2d46fd4f03d5","resolution":{"observed_at":"2026-08-11T20:26:49.087629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.092271Z","title":"A crash course in good and bad controls","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.092271Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:470d447d11e63b804a0070624f0f8479f2b0bf8036ae32931d212484b28f1b1f","observation_id":"54065e70-f661-480c-b050-cb993b19469e","resolution":{"observed_at":"2026-08-11T20:26:49.092271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.096926Z","title":"Coindice: Off-policy confidence interval estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.096926Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:a73518a160c69e88d45da7d240a59cc228fae2b75fd2657f5409c6c3f00a4dee","observation_id":"b3647527-68eb-42b6-ad3c-2c247dc2fb07","resolution":{"observed_at":"2026-08-11T20:26:49.096926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.101485Z","title":"Comment: Reflections on the deconfounder, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.101485Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d0dbeef6b950eae1fafdd470a38d8f293859b55e5cc47c20b54acc44375954d3","observation_id":"ad05cb02-d180-4a4a-9508-f57b7f20b71e","resolution":{"observed_at":"2026-08-11T20:26:49.101485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.105859Z","title":"Two-way fixed effects estimators with heterogeneous treatment effects","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.105859Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d526f9d2617d8d2dd969207a9288f1dc08ce742cddc1a1d689b65ae3a869ec9e","observation_id":"68dde355-1d55-49a3-b452-15c5bef507d5","resolution":{"observed_at":"2026-08-11T20:26:49.105859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06891","last_updated":"2025-06-08T19:29:18Z","snapshot_observed_at":"2026-08-11T00:50:17.909759Z","submitted_at":"2022-02-14T17:24:27Z","title":"Counterfactual inference in sequential experiments","version":5},"cited_work":{"arxiv_id":"2202.06891","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.06891","snapshot_observed_at":"2026-08-11T20:26:50.044056Z","title":"Counterfactual inference in sequential experiments","venue":"stat.ML","work_id":"09984ddf-db0b-4555-a567-3067042bb8bf","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.110445Z"},"links":{"cited_paper":"/paper/2202.06891","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:0025aa3ba168ae7a0258d3cf757f928353758f15cd5e9fd35d3a26d7310546a2","observation_id":"9ea2261c-b5ee-4ba1-aa62-e36811700efe","resolution":{"observed_at":"2026-08-11T20:26:50.049057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.115428Z","title":"A theoretical analysis of deep q-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.115428Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2d18c3c2c9ed9677d86803420276da20a78cd63b86a9f58fba515766f582d1b9","observation_id":"722ea65d-52ee-42d8-9ce1-5a3902d93c9f","resolution":{"observed_at":"2026-08-11T20:26:49.115428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.119846Z","title":"More robust doubly robust off-policy evaluation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.119846Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d35043962a0cde0daabc70b2be3f075fed2fef474b9bcaf6728bd37ff7902732","observation_id":"6dc54f2f-3ac3-4e0a-ba59-30af9c519f98","resolution":{"observed_at":"2026-08-11T20:26:49.119846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.124324Z","title":"Deep neural networks for estimation and inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.124324Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c626d3994d3b941ffbbee53bdc096683dbcf2d2df3321e9e1aea3c27de9b8b36","observation_id":"1aa730a7-d898-46c9-9e90-bd224f8486c2","resolution":{"observed_at":"2026-08-11T20:26:49.124324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.128856Z","title":"Non-parametric panel data models with interactive fixed effects","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.128856Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:a52665cd430e8c075de991fd94225d1975d427b8a7e4651d1c12ee254cb6d87a","observation_id":"d241ef39-edf2-4287-b0e8-deb304ea1fc6","resolution":{"observed_at":"2026-08-11T20:26:49.128856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08666","last_updated":"2022-09-18T22:03:55Z","snapshot_observed_at":"2026-07-06T13:53:33.112275Z","submitted_at":"2022-09-18T22:03:55Z","title":"Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2209.08666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.08666","snapshot_observed_at":"2026-08-11T20:26:50.023708Z","title":"Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes","venue":"cs.LG","work_id":"d8d42a2c-a108-4890-b54c-e9058efc1495","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.133163Z"},"links":{"cited_paper":"/paper/2209.08666","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:b52567d64b167abef5d362677ccaf7ea211c73e3b7a030db2126062e85bf983e","observation_id":"4e1aa98c-71ab-44ca-8711-72bbcd9c208f","resolution":{"observed_at":"2026-08-11T20:26:50.028564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.138132Z","title":"Prediction of treatment response for combined chemo-and radiation therapy for non-small cell lung cancer patients using a bio-mathematical model","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.138132Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:aeac0384615da2b0cd5d1e23f6da46ff9403d96d89fe908e1b8bf788c66ee06a","observation_id":"71f7fafc-e76d-4c41-856e-74588a2a464e","resolution":{"observed_at":"2026-08-11T20:26:49.138132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.142440Z","title":"Issues in assessing the contribution of research and development to productivity growth","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.142440Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:66c695ef7c88ab6599b6126ae985ff325bc0385f798a8cb45f552135fc26bef5","observation_id":"af85bcdc-9ff7-4a0b-bd0c-dc89ad0653d8","resolution":{"observed_at":"2026-08-11T20:26:49.142440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.147024Z","title":"Richard Guo, Anton Rask Lundborg, and Qingyuan Zhao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.147024Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:b4776f387eda896474673ba2d62c2e5cc7db9383f496fefd6fc237de046574b2","observation_id":"4ca90b1d-0ee0-404d-a32e-8736af8529a9","resolution":{"observed_at":"2026-08-11T20:26:49.147024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-11T20:26:49.151455Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.151455Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:560cf2733043f385e125303ea37f0033f0ce2b935d081b77884dda61a03d0cc1","observation_id":"52c89603-207b-4f0a-b66d-ed48e4f6765f","resolution":{"observed_at":"2026-08-11T20:26:49.151455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.156301Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.156301Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:8ada31d19d4853fca36e03e7aecf0160693aa34bb68e4d4d38c09c704fa0f3f2","observation_id":"3bfd73e2-7b4c-4d1b-a9ba-66f424d966f0","resolution":{"observed_at":"2026-08-11T20:26:49.156301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.160798Z","title":"Bootstrapping fitted q-evaluation for off-policy inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.160798Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ae88d8de75b2994dca535071486363f7ecc326ca657c06ed30af0fc6965e8055","observation_id":"fa09841b-afa9-4af0-8f09-c107a472fb7d","resolution":{"observed_at":"2026-08-11T20:26:49.160798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09323","last_updated":"2022-02-28T07:39:59Z","snapshot_observed_at":"2026-07-06T11:01:38.535657Z","submitted_at":"2021-04-16T09:56:39Z","title":"Sequential Deconfounding for Causal Inference with Unobserved Confounders","version":3},"cited_work":{"arxiv_id":"2104.09323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.09323","snapshot_observed_at":"2026-08-11T20:26:49.988791Z","title":"Sequential Deconfounding for Causal Inference with Unobserved Confounders","venue":"stat.ME","work_id":"8dd3090b-50c6-4d0e-b51a-1f7c5ffc77cf","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.165490Z"},"links":{"cited_paper":"/paper/2104.09323","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:8131a47a2a27e5fbb59931268b35a178cb0b197ee9a917c8136bb36138a10358","observation_id":"52f1e374-03d7-4990-9a8d-02939d46e023","resolution":{"observed_at":"2026-08-11T20:26:49.994127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.170520Z","title":"Neural collaborative filtering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.170520Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:4d22dc93afda3d6ce0500c608a7fa13ffa77bb623111c6ac664c8e6492df81aa","observation_id":"7fe94afa-707d-4d74-8f53-c5f8b8746612","resolution":{"observed_at":"2026-08-11T20:26:49.170520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17083","last_updated":"2023-12-01T02:21:35Z","snapshot_observed_at":"2026-08-01T22:27:02.372121Z","submitted_at":"2023-05-26T16:48:05Z","title":"A Policy Gradient Method for Confounded POMDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17083","snapshot_observed_at":"2026-08-11T20:26:49.174755Z","title":"A policy gradient method for confounded pomdps","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.174755Z"},"links":{"cited_paper":"/paper/2305.17083","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:128251f090c43f43c923883d3a8c039ad862915aec586d39d31235ea5f992f2e","observation_id":"1b616d7c-1356-4f6b-8bf4-a49d8e0f5007","resolution":{"observed_at":"2026-08-11T20:26:49.174755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.178967Z","title":"Collaborative filtering for implicit feedback datasets","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.178967Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:83fa69b887b38b4b43e0a63bc8e93889ba3f585cbe869c664f94276654ed8f63","observation_id":"e4cadad5-e646-4614-a495-325ffc3a13c8","resolution":{"observed_at":"2026-08-11T20:26:49.178967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.182754Z","title":"On the use of two-way fixed effects regression models for causal inference with panel data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.182754Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2c18721278f16f0527b03cb7df7c4b256627c8d037ad94f20e55dfeb9764fb17","observation_id":"f18883af-ed44-4dd2-9508-340088c4bad5","resolution":{"observed_at":"2026-08-11T20:26:49.182754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.794689Z","title":"Off-policy evaluation via off-policy classification","venue":null,"work_id":"084e563a-8c4a-4c6f-b004-8fcd47dbec70","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.186790Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:17e144cf3fd3090a3f794409ed79210a0d571b159a903982e63b2780d2f8d671","observation_id":"32386744-8488-4fe7-9487-63338c368b07","resolution":{"observed_at":"2026-08-11T20:26:50.799584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.190846Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.190846Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:43473a050b516856598230f158837a3064dde245136870c7021b29a5fb8cff0a","observation_id":"a127d31e-b7f1-4795-8641-129d4520de1b","resolution":{"observed_at":"2026-08-11T20:26:49.190846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.194737Z","title":"A survey on knowledge graphs: Representation, acquisition, and applications","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.194737Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:19abf269a941176e3b76d00cd132677521afd97246a35d1463468385a44ad76f","observation_id":"71aaaba8-9046-4a8e-94b2-8f8cf63173aa","resolution":{"observed_at":"2026-08-11T20:26:49.194737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09946","last_updated":"2024-04-15T17:15:18Z","snapshot_observed_at":"2026-08-13T00:29:43.212936Z","submitted_at":"2024-04-15T17:15:18Z","title":"A Note on Loss Functions and Error Compounding in Model-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09946","snapshot_observed_at":"2026-08-11T20:26:49.199064Z","title":"A note on loss functions and error compounding in model-based reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.199064Z"},"links":{"cited_paper":"/paper/2404.09946","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d136aadc820fbb85bddf0ee85b783b89750cf8e4a345fc06aa59f7299c00668c","observation_id":"0b532d18-1e37-4f82-a1f3-29eeea0c962c","resolution":{"observed_at":"2026-08-11T20:26:49.199064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.761827Z","title":"Doubly robust off-policy value evaluation for reinforcement learning","venue":null,"work_id":"b5999e80-b39b-420f-87fb-b4f5857da5d2","year":2016},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.203564Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c254a25ec7767c4a95015b98a4d6fce305a2ecf39f4d61f6eff8bdd321760c5a","observation_id":"a49847dc-e071-44ab-8e47-3da895f4dd04","resolution":{"observed_at":"2026-08-11T20:26:50.766712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.208020Z","title":"Mimic-iii, a freely accessible critical care database","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.208020Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c3362cdda836db9d48fcf996ab6b988a7eb62c90ec4793f5fa5da0e2989b7049","observation_id":"af55c0cd-0b26-43a5-a67a-2265db6863e3","resolution":{"observed_at":"2026-08-11T20:26:49.208020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.212413Z","title":"Efficiently breaking the curse of horizon in off-policy evaluation with double reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.212413Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:96ee17a2ab040b6b8bcca144cc128267a9fc45157e8ff555ecedafe179bb7952","observation_id":"64ee11ac-76dd-476a-87f0-6ae58685e7f9","resolution":{"observed_at":"2026-08-11T20:26:49.212413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.729243Z","title":"Confounding-robust policy evaluation in infinite-horizon reinforcement learning","venue":null,"work_id":"5d57313b-145c-4a31-a118-186f0b9c5283","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.216658Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:380297b092b059c46e25a50648dae88caf46b38a1d890c7adaf3c021021a1ca5","observation_id":"0e964bf1-c5cb-41ef-a054-15e682554714","resolution":{"observed_at":"2026-08-11T20:26:50.734020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16583","last_updated":"2023-11-07T04:52:04Z","snapshot_observed_at":"2026-08-11T10:38:08.937902Z","submitted_at":"2022-11-29T20:45:08Z","title":"Offline Policy Evaluation and Optimization under Confounding","version":4},"cited_work":{"arxiv_id":"2211.16583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.16583","snapshot_observed_at":"2026-08-11T20:26:49.938381Z","title":"Offline Policy Evaluation and Optimization under Confounding","venue":"stat.ML","work_id":"be2026bc-f140-4e2d-b000-7463aeba6054","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.221467Z"},"links":{"cited_paper":"/paper/2211.16583","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7d1bc2f074d635c5a7e5a16e88495f7287aab62bfc12510ec0f8a5948ed2daca","observation_id":"94a0e4f1-6eb6-483d-a136-302449c5190e","resolution":{"observed_at":"2026-08-11T20:26:49.943952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.714844Z","title":"Learning mixtures of markov chains and mdps","venue":null,"work_id":"fae4a2ed-c21d-4c04-aaa6-e92fb7538cf1","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.227412Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:fb4c31ab76766685f72379e3a091d6d40ecdedb506e2710a83b13dd4528a4c95","observation_id":"3b6da3e7-58ef-4f93-be19-d93779cdf21d","resolution":{"observed_at":"2026-08-11T20:26:50.719425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.04021","last_updated":"2024-12-24T05:20:59Z","snapshot_observed_at":"2026-08-09T02:40:36.348234Z","submitted_at":"2021-03-06T03:57:46Z","title":"Asymptotic Theory for IV-Based Reinforcement Learning with Potential Endogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.04021","snapshot_observed_at":"2026-08-11T20:26:49.232155Z","title":"Causal reinforcement learning: An instrumental variable approach","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.232155Z"},"links":{"cited_paper":"/paper/2103.04021","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:59e081e864e753e22b931ddf1aa254afaf3d790222e730be97ef33ee94aeab54","observation_id":"0e270572-5815-4174-bd97-59858a67f107","resolution":{"observed_at":"2026-08-11T20:26:49.232155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09907","last_updated":"2024-10-14T22:26:38Z","snapshot_observed_at":"2026-08-09T02:23:11.081591Z","submitted_at":"2021-02-19T13:01:40Z","title":"Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09907","snapshot_observed_at":"2026-08-11T20:26:49.237033Z","title":"Instrumental variable value iteration for causal offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.237033Z"},"links":{"cited_paper":"/paper/2102.09907","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:1aba441fd5a62d57b9115f61214f4162708b6f882c98bc45b92e7e5afc621cdb","observation_id":"ff919683-2e4f-47ab-94b7-05a99ee2375c","resolution":{"observed_at":"2026-08-11T20:26:49.237033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.700946Z","title":"Off-policy estimation of long-term average outcomes with applications to mobile health","venue":null,"work_id":"1e2570c1-f2bd-4d21-9ee9-548b0123c476","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.241606Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:bb29d6a019395c57cbcceb2ec918583a25567aa08660d38e1cb3826ceadb0ce2","observation_id":"d548c79c-5569-492f-bacf-4f08e31279a2","resolution":{"observed_at":"2026-08-11T20:26:50.705579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.685680Z","title":"Batch policy learning in average reward markov decision processes","venue":null,"work_id":"2f58ae94-9247-4446-93c5-c5b049841a14","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.245977Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:a339e9e71a3e599e327aec53e681915f515eadbf35e27f230639984e905f5cfd","observation_id":"b53a4e2a-c74e-4d51-9b97-02e1eeb4febb","resolution":{"observed_at":"2026-08-11T20:26:50.690923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.250321Z","title":"Forecasting treatment responses over time using recurrent marginal structural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.250321Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d91f76b7f2d303dadf4839969fbc200051a0713d92a73a3ab59f4aca8227eef4","observation_id":"4e5d4ad9-54f4-44a1-ac39-e5d5a85ef690","resolution":{"observed_at":"2026-08-11T20:26:49.250321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.254963Z","title":"Breaking the curse of horizon: Infinite-horizon off-policy estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.254963Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:15d1ba9fb8e18fc2f4d6b086d4f0997afcd66986c9103cc90e482f57588979d2","observation_id":"65385c22-c2a2-4eff-b63e-d9162e098533","resolution":{"observed_at":"2026-08-11T20:26:49.254963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.653889Z","title":"Provably good batch off-policy reinforcement learning without great exploration","venue":null,"work_id":"fd92ce24-6a9e-435d-a3dd-1e59ff8f13fc","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.259473Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:8e81de6ebbf7f7035ad1f276c97d43fbcb3e821118c7cdd252056e85f912cc7a","observation_id":"0cc27e4d-b8ac-4b9f-bd0f-8969dd803f30","resolution":{"observed_at":"2026-08-11T20:26:50.658294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.264028Z","title":"Causal effect inference with deep latent-variable models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.264028Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2a212d337dca14c146fac6c9d2a4c61c1264ee6710860c21ade07415480563be","observation_id":"6020fd7c-11f3-408c-8ef3-d621c217b820","resolution":{"observed_at":"2026-08-11T20:26:49.264028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.10576","last_updated":"2018-12-26T23:48:51Z","snapshot_observed_at":"2026-08-11T21:21:24.668880Z","submitted_at":"2018-12-26T23:48:51Z","title":"Deconfounding Reinforcement Learning in Observational Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.10576","snapshot_observed_at":"2026-08-11T20:26:49.268555Z","title":"Deconfounding reinforcement learning in observational settings","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.268555Z"},"links":{"cited_paper":"/paper/1812.10576","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:54c4b802d391e6b617e4304f8592d390b1c35d3c4448c34fd171ea5f716614f5","observation_id":"011c4092-9749-427a-9ef8-26338579198c","resolution":{"observed_at":"2026-08-11T20:26:49.268555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.631960Z","title":"Pessimism in the face of confounders: Provably efficient offline reinforcement learning in partially observable markov decision processes","venue":null,"work_id":"b1e64288-d342-45fd-8dd1-2a3a3a912dff","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.273622Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d838fdfac3eb315cca3397e9922d0f1109ffaa2a7aa712d52d70df38df86fe9f","observation_id":"fd481239-bf69-4c47-9a24-db357de512c5","resolution":{"observed_at":"2026-08-11T20:26:50.636096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.618947Z","title":"Estimating causal peer influence in homophilous social networks by inferring latent locations","venue":null,"work_id":"e4a89fd6-60e2-41e3-a082-e38e506b91e4","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.278278Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:4a994cab5019f814a0665f2e6cab376ae48d5cad17adec80225bf7bc9d65a3c3","observation_id":"4a51b86d-dc62-426d-afdc-9fa3765d7c6b","resolution":{"observed_at":"2026-08-11T20:26:50.623463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.605391Z","title":"Off-policy evaluation for episodic partially observable markov decision processes under non-parametric models","venue":null,"work_id":"f5507be4-e3c8-4d02-a6c2-c8a822fac07b","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.282744Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:be96291e950a4dbecbfcb123fdaed07a199a043a84b945f5489c4f6493ff0512","observation_id":"32153b46-476a-4467-aeae-7b83e851470e","resolution":{"observed_at":"2026-08-11T20:26:50.609868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.591360Z","title":"Empirical production function free of management bias","venue":null,"work_id":"fe99c963-6fdd-41c4-98e4-25d064368d72","year":1961},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.286681Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:e0ee1e9245b43c1c5617a12e89104b94885c0a94cffe57fed266ca233133cae2","observation_id":"fc41d0e5-9d07-4f21-8904-5012e55c1384","resolution":{"observed_at":"2026-08-11T20:26:50.595983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10502","last_updated":"2021-09-22T03:36:51Z","snapshot_observed_at":"2026-08-06T07:02:30.814685Z","submitted_at":"2021-09-22T03:36:51Z","title":"A Spectral Approach to Off-Policy Evaluation for POMDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10502","snapshot_observed_at":"2026-08-11T20:26:49.290906Z","title":"A spectral approach to off-policy evaluation for pomdps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.290906Z"},"links":{"cited_paper":"/paper/2109.10502","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2e277e95c6f031fa85a929663c80906f8a7293717974759477be31ada48dff66","observation_id":"56e8f4d9-725a-4e58-8577-1a4e69e10266","resolution":{"observed_at":"2026-08-11T20:26:49.290906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.577354Z","title":"Off-policy policy evaluation for sequential decisions under unobserved confounding","venue":null,"work_id":"39d60e48-84c0-44dd-ab72-5c40ead0605c","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.295005Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:11a63a551d6c37ca79406d07a93febd0b2778bbd907b6666ae4518418c21ed2b","observation_id":"37f99efe-7629-4a6a-9394-86ee51e38913","resolution":{"observed_at":"2026-08-11T20:26:50.582136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02121","last_updated":"2018-03-13T07:45:20Z","snapshot_observed_at":"2026-08-10T15:47:03.650389Z","submitted_at":"2017-12-06T10:41:47Z","title":"A Novel Embedding Model for Knowledge Base Completion Based on Convolutional Neural Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.02121","snapshot_observed_at":"2026-08-11T20:26:49.299285Z","title":"A novel embedding model for knowledge base completion based on convolutional neural network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.299285Z"},"links":{"cited_paper":"/paper/1712.02121","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2070f46a649f8748efd3d3488947ef9431be263e97009e18d3de5ff3a927c429","observation_id":"54907508-141e-4877-a4e4-f4268c6c760a","resolution":{"observed_at":"2026-08-11T20:26:49.299285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.563124Z","title":"A review of relational machine learning for knowledge graphs","venue":null,"work_id":"556f1bc3-3b24-468b-aca9-716c5b6a3c51","year":2015},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.304112Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:052ddaa6c05115b7775acff7b3cc1427fbc9a4bfcc167a17f23f37f72c979bdf","observation_id":"d57eeb98-a197-4cfd-92f9-518be18c6ab6","resolution":{"observed_at":"2026-08-11T20:26:50.567741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.548657Z","title":"Automated cars meet human drivers: responsible human-robot coordination and the ethics of mixed traffic","venue":null,"work_id":"efaa7d57-6736-4a85-9033-9412285e5ac0","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.308697Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7df515f90f6f4417dc3180bc72b22a19184e877a8238bad1d894a153ed051f9c","observation_id":"eca033d3-c3ed-4dac-b4a0-4093929bb8f9","resolution":{"observed_at":"2026-08-11T20:26:50.553282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.313162Z","title":"blessings of multiple causes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.313162Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7d11320f94fcaa4187feaea549675c5f561808b6c325e439fb17a385f4570f99","observation_id":"0502d09e-fd3a-4c68-99bd-16bd2ce1a339","resolution":{"observed_at":"2026-08-11T20:26:49.313162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06555","last_updated":"2020-04-24T15:30:13Z","snapshot_observed_at":"2026-08-10T22:47:52.667987Z","submitted_at":"2020-01-17T23:33:32Z","title":"Counterexamples to \"The Blessings of Multiple Causes\" by Wang and Blei","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06555","snapshot_observed_at":"2026-08-11T20:26:49.317636Z","title":"the blessings of multiple causes","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.317636Z"},"links":{"cited_paper":"/paper/2001.06555","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:a0062f8b76ebf4fad2728291850f003cc70b4c856d11f27e1a6f083df8e576e5","observation_id":"cd511ddc-54a8-4ae9-8bf4-841a0c66b884","resolution":{"observed_at":"2026-08-11T20:26:49.317636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.534802Z","title":"A critical look at the consistency of causal estimation with deep latent variable models","venue":null,"work_id":"0519ef85-dc6a-46ad-b5cc-a1cf7f8163ca","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.322630Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6e2b8f0e560a77e82615e3f90a088f512900f0d1a23b7f046d1d8b3c43d54858","observation_id":"f03a237d-00ca-423b-81c7-15fef16315ff","resolution":{"observed_at":"2026-08-11T20:26:50.539284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.521052Z","title":"Doubly robust difference-in-differences estimators","venue":null,"work_id":"1f2234cc-dc91-4941-997e-4fdd5db24edf","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.327210Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:adbb0561936b3344551cd6e2a8d773a00196b1a6ab354b186accefe719c8f72a","observation_id":"0df06961-fb28-404c-9c24-a728d438e613","resolution":{"observed_at":"2026-08-11T20:26:50.525737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.506247Z","title":"Importance resampling for off-policy prediction","venue":null,"work_id":"284ddea3-a4bb-4607-b9a6-51ee9ec1013c","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.331634Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:1f422e15b719ac8d7d995768944aa1435b0198e2c179dee784c4331effc6d4bf","observation_id":"a4e00b95-682b-4952-895e-f771f7975623","resolution":{"observed_at":"2026-08-11T20:26:50.511247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.336054Z","title":"Nonparametric regression using deep neural networks with relu activation function","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.336054Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:dc2a691a01529f11e984b86449144dab8fb7bbaf37903de18afef62e3c5f1369","observation_id":"76918f35-ec26-4eb2-a005-7527cb92a1ce","resolution":{"observed_at":"2026-08-11T20:26:49.336054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08209","last_updated":"2023-09-14T18:13:57Z","snapshot_observed_at":"2026-08-03T02:15:05.895319Z","submitted_at":"2022-11-14T04:14:37Z","title":"On counterfactual inference with unobserved confounding","version":3},"cited_work":{"arxiv_id":"2211.08209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.08209","snapshot_observed_at":"2026-08-11T20:26:49.768069Z","title":"On counterfactual inference with unobserved confounding","venue":"cs.LG","work_id":"1c1d96f7-0136-4c1b-ad8f-59f344194dd9","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.340724Z"},"links":{"cited_paper":"/paper/2211.08209","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ae88ba3633683c1e8202536077cb50dafb002c2d35f961a4d36226d7935e6912","observation_id":"c94b25b5-0eb0-49ce-b030-b6d9692cd316","resolution":{"observed_at":"2026-08-11T20:26:49.773072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.491089Z","title":"Does the markov decision process fit the data: Testing for the markov property in sequential decision making","venue":null,"work_id":"e341edd5-8041-49a7-8e89-dd1ad7e1df88","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.345607Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ecb561f1803c52a40beed2edb75ba8f8f695e03b75c2a81d8d58e04fa7485953","observation_id":"067ac510-944f-4d18-b6cb-84dc2de34cb7","resolution":{"observed_at":"2026-08-11T20:26:50.495984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.476308Z","title":"Deeply-debiased off-policy interval estimation","venue":null,"work_id":"2e63989f-b96a-42f3-965d-ead9615c4f8f","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.350052Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:952565541f3c092e3e6800151a2b206369394424ff8b237499b167d5ed66a537","observation_id":"dba602c9-a56e-4e02-af6c-fd7fbd4fcb16","resolution":{"observed_at":"2026-08-11T20:26:50.481440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.462245Z","title":"A minimax learning approach to off-policy evaluation in confounded partially observable markov decision processes","venue":null,"work_id":"0ecaef10-d599-448e-8016-988fb54ad676","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.354184Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:89e719b1a52ac457d5962b1cce4d87bf0d62dc6699f0253e7b0c5073c28fb7b4","observation_id":"01a0abe7-28ec-40c9-b6fa-76afeb142d23","resolution":{"observed_at":"2026-08-11T20:26:50.467036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.447200Z","title":"Statistical inference of the value function for reinforcement learning in infinite-horizon settings","venue":null,"work_id":"366e668c-7f0f-4c5e-90a2-245c6357e29c","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.358732Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6254b7713484e7c1d50560374ee14242be1171edf42637e34064ed0d4be86d41","observation_id":"9397cc0a-09a2-462f-8e3e-0ea8651c291e","resolution":{"observed_at":"2026-08-11T20:26:50.451972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.432610Z","title":"Off-policy confidence interval estimation with confounded markov decision process","venue":null,"work_id":"644cf926-1bf0-4c5f-856f-18bb40c64cc9","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.363172Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:e64e8741083addb84ae8dabce8315c55c38e93bffa58f82ee897c954a3642cd1","observation_id":"f75aea1e-95db-497e-83dd-6c2ecff17798","resolution":{"observed_at":"2026-08-11T20:26:50.437357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2311.16793","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.740437Z","title":"Mediation pathway selection with unmeasured mediator-outcome confounding","venue":null,"work_id":"e62aeb78-64ec-41d4-aafd-44884bad6397","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.367414Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:0b4eaf766d618c49bd592dcaed5a36459a01393a3635fb8880bc8407f5f1771f","observation_id":"611f730e-97af-4690-94ad-937ecc2f2c3f","resolution":{"observed_at":"2026-08-11T20:26:49.752062Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.371847Z","title":"Reasoning with neural tensor networks for knowledge base completion","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.371847Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:b0868ac7714438514b50a373a6ba5f2dcf5ed3b6689f43a0ab59d905c91d43e9","observation_id":"5a207d18-b0e6-48f3-9c1d-8d6dfc330435","resolution":{"observed_at":"2026-08-11T20:26:49.371847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.376356Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.376356Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6906a928aa537d0d2d3ebd9f4f167c64abf2f40dad85f412d28a3da5eba5e1f7","observation_id":"8bf13f72-5146-4824-b96b-f6c32cf73b4b","resolution":{"observed_at":"2026-08-11T20:26:49.376356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07186","last_updated":"2019-10-16T06:33:17Z","snapshot_observed_at":"2026-08-13T07:32:12.415634Z","submitted_at":"2019-10-16T06:33:17Z","title":"Doubly Robust Bias Reduction in Infinite Horizon Off-Policy Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07186","snapshot_observed_at":"2026-08-11T20:26:49.381181Z","title":"Doubly robust bias reduction in infinite horizon off-policy estimation","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.381181Z"},"links":{"cited_paper":"/paper/1910.07186","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:77a65032d613721377cb0fb3abcc4e9b4e4d11f50ad17d806f43e22f373b8105","observation_id":"e254b7c3-ddd9-4d3c-a61e-477b512f9f93","resolution":{"observed_at":"2026-08-11T20:26:49.381181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10982","last_updated":"2020-09-23T07:46:53Z","snapshot_observed_at":"2026-08-09T15:43:39.835495Z","submitted_at":"2020-09-23T07:46:53Z","title":"An Introduction to Proximal Causal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10982","snapshot_observed_at":"2026-08-11T20:26:49.385666Z","title":"An introduction to proximal causal learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.385666Z"},"links":{"cited_paper":"/paper/2009.10982","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2490eb6c31102eb6e75125164cbc14fffaf55025e1f2cb87bcd30f69fc810238","observation_id":"ff5acfdd-eea0-4bea-915a-509ac1b12643","resolution":{"observed_at":"2026-08-11T20:26:49.385666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.400565Z","title":"Off-policy evaluation in partially observable environments","venue":null,"work_id":"9748cc74-b854-45a7-bf04-3da2fda1b518","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.390375Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:04b005bc52c915f48a34bdb9deb7a164a0aa08fdab5996e3eedd144d3eaac171","observation_id":"f53839b7-c0a4-4ed0-a2b4-dde6c539d20f","resolution":{"observed_at":"2026-08-11T20:26:50.405119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.386471Z","title":"Data-efficient off-policy policy evaluation for reinforcement learning","venue":null,"work_id":"db60124a-9dec-4530-aee6-3e2d909eeaab","year":2016},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.394915Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:dafe44898c10cfa07087173131d83a810eb8c76cab3f3d54e127b5cc5621b92c","observation_id":"2b35f4a5-8d54-4921-9d90-dacbeb46223a","resolution":{"observed_at":"2026-08-11T20:26:50.391180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.371527Z","title":"High-confidence off-policy evaluation","venue":null,"work_id":"c23d9293-5f7f-4225-9876-b5add4a2e8be","year":2015},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.399443Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:f632dc2e04326cef0a49c46c5d028fc796c07d59ba85e8f36ce2e2ae4b211849","observation_id":"3538c71c-a3a8-4ff6-975c-c9a846b1b822","resolution":{"observed_at":"2026-08-11T20:26:50.376590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10742","last_updated":"2017-10-30T02:05:10Z","snapshot_observed_at":"2026-07-06T06:06:40.044133Z","submitted_at":"2017-10-30T02:05:10Z","title":"Implicit Causal Models for Genome-wide Association Studies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10742","snapshot_observed_at":"2026-08-11T20:26:49.403988Z","title":"Implicit causal models for genome-wide association studies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.403988Z"},"links":{"cited_paper":"/paper/1710.10742","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:fb3e0fc0d92345d728793e1cb7f7b72ddf119818ce0192c3f55cdcc3069f28f5","observation_id":"aa3f4e79-c057-494b-94b1-6dd011a90948","resolution":{"observed_at":"2026-08-11T20:26:49.403988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06226","last_updated":"2023-01-10T04:15:46Z","snapshot_observed_at":"2026-08-10T09:08:03.746167Z","submitted_at":"2021-07-13T16:30:01Z","title":"Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06226","snapshot_observed_at":"2026-08-11T20:26:49.408990Z","title":"Pessimistic model-based offline RL: PAC bounds and posterior sampling under partial coverage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.408990Z"},"links":{"cited_paper":"/paper/2107.06226","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:b485155c26d3d5f56d02a008f68ae84076b4cf45ca5acab40c2be3d3e0f51d82","observation_id":"8e91b53c-552f-45e5-ad6e-80d394d79687","resolution":{"observed_at":"2026-08-11T20:26:49.408990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.413790Z","title":"Minimax weight and q-function learning for off-policy evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.413790Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:4b9ca0a842dee8a50a386013d4261804a74d45833a475d731b06f752bf07936f","observation_id":"b6b9adc8-d1cd-4b59-b49e-c42fafb9b975","resolution":{"observed_at":"2026-08-11T20:26:49.413790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.347576Z","title":"Using embeddings to correct for unobserved confounding in networks","venue":null,"work_id":"d03d9955-3038-42a0-97b2-2a5796d10d96","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.418982Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:1a8dbe38e16d920471bc3f4a7a53a4c857c1c54217edcb5d9b220bba905697c9","observation_id":"f501c8cd-c13f-4e91-ab43-6980c84cd4be","resolution":{"observed_at":"2026-08-11T20:26:50.352098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.423736Z","title":"Adapting text embeddings for causal inference","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.423736Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:0cd520c1d524716238ba74643a095ce1aa8a312431629f7f90917db38feb9db8","observation_id":"da6374d8-9829-4a5f-b237-bcc3689aef74","resolution":{"observed_at":"2026-08-11T20:26:49.423736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.324959Z","title":"Relational deep learning: A deep latent variable model for link prediction","venue":null,"work_id":"4a89564d-006a-4810-951a-009795615170","year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.428544Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:115c7d8efcd0a716bcc31a9fe0f81f55ddfedcac77cb820c91dab9d9d0036ee5","observation_id":"3b16c69a-bd9d-4fc2-a840-e839d600de9d","resolution":{"observed_at":"2026-08-11T20:26:50.329080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15448","last_updated":"2026-06-02T22:28:41Z","snapshot_observed_at":"2026-07-06T13:58:14.551432Z","submitted_at":"2022-09-29T16:03:07Z","title":"Blessing from Human-AI Interaction: Super Reinforcement Learning in Confounded Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15448","snapshot_observed_at":"2026-08-11T20:26:49.433207Z","title":"Blessing from experts: Super reinforcement learning in confounded environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.433207Z"},"links":{"cited_paper":"/paper/2209.15448","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:3f889b5aa37cc08921a6f049ddb6c505394eabf4b3f69b105c55b6fee15ca73e","observation_id":"1f3480fa-a383-465c-8444-211ed4b6ea20","resolution":{"observed_at":"2026-08-11T20:26:49.433207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.311622Z","title":"Provably efficient causal reinforcement learning with confounded observational data","venue":null,"work_id":"d91f830c-4ca0-4118-a937-77b4a4982636","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.438145Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6ad1e88e3406c2fa748cbe079b2360e0dbe1f0b26e169aa7b14ecb73f38c1b02","observation_id":"4b0b5083-cc16-4f7f-bcf0-a517aa9b41f3","resolution":{"observed_at":"2026-08-11T20:26:50.315863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.298118Z","title":"The blessings of multiple causes","venue":null,"work_id":"a1ded2c1-c0bd-4898-8792-79e45a4bf7f0","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.442778Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:bcb3312d30e51bf1f3bcf53789779b2af06e10b43ea89c87bd0b3b8279960a95","observation_id":"bdf0cca4-42c4-44f5-a381-04d74a0cc6f8","resolution":{"observed_at":"2026-08-11T20:26:50.302272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06581","last_updated":"2019-05-27T10:17:09Z","snapshot_observed_at":"2026-07-06T06:56:30.962909Z","submitted_at":"2018-08-20T17:41:39Z","title":"The Deconfounded Recommender: A Causal Inference Approach to Recommendation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06581","snapshot_observed_at":"2026-08-11T20:26:49.447182Z","title":"The deconfounded recommender: A causal inference approach to recommendation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.447182Z"},"links":{"cited_paper":"/paper/1808.06581","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:34bead60bc98e460d04061e121747713aa79c61ad067e5559a1f793496189b17","observation_id":"62992a5b-55ea-4fb3-a59e-7beabeab7809","resolution":{"observed_at":"2026-08-11T20:26:49.447182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.284007Z","title":"Semiparametrically efficient off-policy evaluation in linear markov decision processes","venue":null,"work_id":"ab6ebfb0-7c2b-4618-827b-a92803273999","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.451301Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:5a27d9916875085a9a93d2fa067c96b5a3703f6f6e9c6124b8aa95c64b933724","observation_id":"358dc732-754a-4111-847a-086c856d366f","resolution":{"observed_at":"2026-08-11T20:26:50.288702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.269784Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginalized importance sampling","venue":null,"work_id":"03115336-6759-490e-b4c8-ef09be752aa4","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.455826Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d4905433dad92ccdd2c3a5143d28aaf0492c9d192224675bd5b64d7d0e40e16b","observation_id":"3c3c5a1d-a062-4258-96ee-c74991263fb6","resolution":{"observed_at":"2026-08-11T20:26:50.274909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.255506Z","title":"An instrumental variable approach to confounded off-policy evaluation","venue":null,"work_id":"6b9afea2-a0c0-4897-b8f4-219ffbe76e82","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.460191Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:9276e2456875f4e59a2ee715b219b94cd772a646e03afda092e4a92a57c33c0f","observation_id":"eb66cdb4-473c-43a7-a7f0-558b3da967f7","resolution":{"observed_at":"2026-08-11T20:26:50.260239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11040","last_updated":"2022-08-23T15:32:44Z","snapshot_observed_at":"2026-07-06T13:44:41.231513Z","submitted_at":"2022-08-23T15:32:44Z","title":"Strategic Decision-Making in the Presence of Information Asymmetry: Provably Efficient RL with Algorithmic Instruments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11040","snapshot_observed_at":"2026-08-11T20:26:49.464366Z","title":"Strategic decision-making in the presence of information asymmetry: Provably efficient rl with algorithmic instruments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.464366Z"},"links":{"cited_paper":"/paper/2208.11040","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:e348d517f3a45483ea4c13f3de5de0336260e6f7756e13e4db69f7f8a943d432","observation_id":"7f363e52-78a9-4d07-b6c1-8d1bd082a64d","resolution":{"observed_at":"2026-08-11T20:26:49.464366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T11:56:22.066422Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":8,"verified_fuzzy":32},"total_outbound_references":106},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 106 outbound references and 1 inbound Pith citation observation for arXiv:2412.05783."}