{"as_of":"2026-08-16T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a938b6b53ea0a2fcc1c73e738fc4c49ca18a6fb7aae65734c5585b083c9e8be6","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:14:55.422016Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.13809/citation-record","integrity":"/paper/2505.13809/integrity","json":"/paper/2505.13809/citation-record.json","paper":"/paper/2505.13809"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.650926Z","title":"& Abbeel, P","venue":null,"work_id":"020676c9-d084-48ac-b299-cbed1eea5f8a","year":2017},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.353000Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:10eb2bdd2a13d664b02b6372b4c1d1baf15eeee079438b7557eff3e1d5b58ed0","observation_id":"8afd3d04-3793-45d1-9288-f83cdee74b35","resolution":{"observed_at":"2026-08-15T20:14:55.655675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.583822Z","title":"Ψ˚pPq´E P “ QpPqpA,S;πqπpA|Sq ‰ “EP “ QpPqpA,S;π ˚pPqqπ˚pPqpA|Sq ‰ ´EP “ QpPqpA,S;πqπpA|Sq ‰ “EP “ QpPq ` A,S;π ˚pPq ˘` π˚pPqpA|Sq´πpA|Sq ˘‰ `EP","venue":null,"work_id":"eb15b0c3-cd44-4bd1-a3e7-3832840f742e","year":2025},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.405526Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:2578be3e3630f24e1108cf072b9a993d149143d532070e606a969c53594e69f5","observation_id":"92053903-744a-47ac-bd72-203bd4179011","resolution":{"observed_at":"2026-08-15T20:14:55.589897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.549455Z","title":"By Theorem 25.32 of Van Der Vaart (2000), there exists no estimator sequence for Ψ ˚ that is regular atP ϵ, and hence there exists no RAL estimator for Ψ ˚ atP","venue":null,"work_id":"aa6ad540-4306-46eb-8dc8-b9fb8e813431","year":2000},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.416702Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:691edb3a18be351d99f29bf6d107451b1e6ba5bc84af7f0a0e2a7d61f80e9b67","observation_id":"1c9dd6f1-f501-4084-bcd0-dc0ade227e07","resolution":{"observed_at":"2026-08-15T20:14:55.555576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.532323Z","title":"pηNSAVE´ηwppπpQqq “","venue":null,"work_id":"88008ced-986d-406c-bbe9-f82b85d19832","year":2022},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.422016Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:5c55368fa340e6aba69f94691486f5cd6891a0ee2e6fb8e7939bab4a29c3bf09","observation_id":"58f163da-b520-4dc4-b13b-98d2f4e2163f","resolution":{"observed_at":"2026-08-15T20:14:55.538269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05405","last_updated":"2025-04-07T18:19:56Z","snapshot_observed_at":"2026-08-13T16:41:52.408921Z","submitted_at":"2025-04-07T18:19:56Z","title":"The Role of Environment Access in Agnostic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05405","snapshot_observed_at":"2026-08-15T20:14:55.367289Z","title":"& Uehara, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.367289Z"},"links":{"cited_paper":"/paper/2504.05405","citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:e0d656a17090542bcb263e4eb987b119a4dc35745d90eb110018a881fc5dfe16","observation_id":"e3ea3dba-1c28-43c9-8b96-cb5c678c4cea","resolution":{"observed_at":"2026-08-15T20:14:55.367289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.635272Z","title":null,"venue":null,"work_id":"30102496-e274-404a-80d4-54460e1d2ce2","year":1975},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":688,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.360336Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:8614126076f29c7aabe01d2407278e2a6c8a082af40607d73672a207eca271c2","observation_id":"2717d0b3-b903-49de-a6ea-1f562a96d27b","resolution":{"observed_at":"2026-08-15T20:14:55.640304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-08-14T20:59:03.934741Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-15T20:14:55.379705Z","title":"dynamic treatment regimes: Technical challenges and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":713,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.379705Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:9ccd9519fb82a51b2a013229c8dd9cc205a619c1ba80ba9195cbc16d31b42861","observation_id":"528d8283-46c7-44e1-a8dc-bf98ed3b662c","resolution":{"observed_at":"2026-08-15T20:14:55.379705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T20:14:55.373331Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":1225,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.373331Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:8816a76befd31ba6379e6be198ed8fad72607fe4e605825fa9d54fcf188009aa","observation_id":"d881e405-e303-4f3a-983a-cfbe19340b71","resolution":{"observed_at":"2026-08-15T20:14:55.373331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.567233Z","title":"1 p1´γq 2 EP0 “ V ` S;π˚pPϵq ˘ ´V ` S;π˚pP0q ˘‰ ` 1 1´γ EP0,S„ωp¨¨¨;π˚pP0qq „ EA„π˚pPϵq","venue":null,"work_id":"365effda-152e-4a53-8179-7c0fbda5218c","year":2000},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.411001Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:8c99813867ac017253fef2e5040911f03369df42f4fa9e2f72a6163e4740e765","observation_id":"7acdadff-1da1-49e1-95a3-fba1adf803fc","resolution":{"observed_at":"2026-08-15T20:14:55.571994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.618124Z","title":"(13) The second tool for obtaining the lower bound is the reverse Cauchy-Schwarz inequality (see the result for integrals in Corollary 6.1 of Aldaz et al","venue":null,"work_id":"f75bc9d0-88e8-4e64-a903-0e2b39386927","year":2015},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.393729Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:1c64778717a6786f5246a946ff987f63c04ec3e3fe3f242edbda4ef9272a6f33","observation_id":"0f76220f-9f6a-4113-ba6a-38c1652077df","resolution":{"observed_at":"2026-08-15T20:14:55.623647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:55.601163Z","title":"It remains to upper bound the first term on the right-hand side of (14)","venue":null,"work_id":"f63e56f0-2854-41db-9c9c-ff1f7de8ff4e","year":1966},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.399029Z"},"links":{"citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:f86e63f1c84c9440338329ede7a2711dba525c194efeab175da34ad88ef84ec3","observation_id":"7e554d34-5e25-4908-80db-d8d8af7d830d","resolution":{"observed_at":"2026-08-15T20:14:55.606406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-13T13:23:03.818353Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-15T20:14:55.385777Z","title":"Contextual Switch","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":9668,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.385777Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:284aef8ec1067d9cb380c0a0e069268999d02b6fcb743b5edfe45b4fb83292aa","observation_id":"6ebb3824-b34c-4ddb-a2ba-ceddff9ba563","resolution":{"observed_at":"2026-08-15T20:14:55.385777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","latest_version":5,"primary_category":"math.ST","snapshot_observed_at":"2026-08-15T20:07:44.591905Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2505.13809."}