{"as_of":"2026-08-14T19:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f7df9a2d2619690287eb313552fc28a281e42d45e8c36407945f5c7eaed254a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:59:43.198273Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T14:33:54.441902Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-08-06T18:59:43.198273Z","title":"M., Jiang, N., and Yue, Y","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.06961","last_updated":"2025-07-09T15:46:39Z","snapshot_observed_at":"2026-08-06T18:48:20.308095Z","submitted_at":"2025-07-09T15:46:39Z","title":"Off-Policy Evaluation Under Nonignorable Missing Data","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T18:59:43.198273Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2507.06961"},"observation_digest":"sha256:5b18f398bdfae0c6dec30ca4e9e7caf26410548724f03cc9d8c32939652fb8eb","observation_id":"daf5ec59-b9ec-45d2-9b0b-1355b7dab123","resolution":{"observed_at":"2026-08-06T18:59:43.198273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-08-04T13:00:09.551445Z","title":"Empirical study of off-policy policy evaluation for reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-14T11:47:40.549838Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:09.551445Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:e30f702a283063d821d52c4edd6e5416f7ce0355444b1d06c0b5e784f7039aa7","observation_id":"5f03b118-fe6d-4584-bc95-413a32e2d38a","resolution":{"observed_at":"2026-08-04T13:00:09.551445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1911.06854","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-07-07T14:33:54.441902Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","venue":"cs.LG","work_id":"e0a0f328-5f09-455b-8d7c-2159f9a416a7","year":2019},"citing_paper":{"arxiv_id":"2606.01028","last_updated":"2026-05-31T05:36:03Z","snapshot_observed_at":"2026-08-02T19:36:00.357982Z","submitted_at":"2026-05-31T05:36:03Z","title":"MedGym:A Unified Continuous-Time Benchmark for Dynamic Medical Treatment Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:37.376343Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2606.01028"},"observation_digest":"sha256:b44f85c37d3e95725c5ef756665097faecbbc97997ae2f863293e01facc162ee","observation_id":"17fb03ed-4e93-4b4e-b7cb-4295feb810d8","resolution":{"observed_at":"2026-07-01T21:06:13.695187Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1911.06854","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-07-07T14:33:54.441902Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","venue":"cs.LG","work_id":"e0a0f328-5f09-455b-8d7c-2159f9a416a7","year":2019},"citing_paper":{"arxiv_id":"2606.05558","last_updated":"2026-07-20T15:11:36Z","snapshot_observed_at":"2026-08-07T08:16:56.971178Z","submitted_at":"2026-06-04T01:13:24Z","title":"Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T02:53:54.942603Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2606.05558"},"observation_digest":"sha256:daa5a89926f7a1c6e679eb5c79042b8d2d3da0d5311006a015d99dabc7ba3dec","observation_id":"a77fb6c2-c596-4c43-b9b6-49d309c4b0c2","resolution":{"observed_at":"2026-07-02T11:46:56.123242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-08-02T12:24:48.810739Z","title":"Empirical study of off-policy policy evaluation for reinforcement learning.arXiv preprint arXiv:1911.06854,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2606.05558","last_updated":"2026-07-20T15:11:36Z","snapshot_observed_at":"2026-08-07T08:16:56.971178Z","submitted_at":"2026-06-04T01:13:24Z","title":"Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents","version":2},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-02T12:24:48.810739Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2606.05558"},"observation_digest":"sha256:2117091e923561a34cc83995380e191781dc67e9a6271aa512ee78b6033a2a82","observation_id":"09354f68-833e-42fd-953b-a641e070e521","resolution":{"observed_at":"2026-08-02T12:24:48.810739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1911.06854","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-07-07T14:33:54.441902Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","venue":"cs.LG","work_id":"e0a0f328-5f09-455b-8d7c-2159f9a416a7","year":2019},"citing_paper":{"arxiv_id":"2606.20206","last_updated":"2026-06-18T13:19:43Z","snapshot_observed_at":"2026-08-06T08:02:19.305046Z","submitted_at":"2026-06-18T13:19:43Z","title":"Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T15:38:16.806415Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2606.20206"},"observation_digest":"sha256:54fc875e2d9a50b4461c00bd83039a5ff3c7bdfee5a71507a5276236cf872a66","observation_id":"456e3113-319c-4082-9cf0-80b2ab594428","resolution":{"observed_at":"2026-07-04T05:39:40.718347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1911.06854","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-07-07T14:33:54.441902Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","venue":"cs.LG","work_id":"e0a0f328-5f09-455b-8d7c-2159f9a416a7","year":2019},"citing_paper":{"arxiv_id":"2607.05375","last_updated":"2026-07-28T16:20:46Z","snapshot_observed_at":"2026-08-13T17:58:17.954177Z","submitted_at":"2026-07-06T17:53:32Z","title":"Fitted Occupancy-Ratio Evaluation without Bellman Completeness","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-07T14:25:33.921937Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2607.05375"},"observation_digest":"sha256:6cb5e1e5060b501b1870e31c19b3e3d2e2390e5f4d7ef5b684129a0b3578ce65","observation_id":"acdee659-2dcf-4622-804e-1e19289bd25e","resolution":{"observed_at":"2026-07-07T14:33:54.443180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-08-02T08:33:40.502503Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05375","last_updated":"2026-07-28T16:20:46Z","snapshot_observed_at":"2026-08-13T17:58:17.954177Z","submitted_at":"2026-07-06T17:53:32Z","title":"Fitted Occupancy-Ratio Evaluation without Bellman Completeness","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-02T08:33:40.502503Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2607.05375"},"observation_digest":"sha256:f5f782703a98245e384c31b14c2e3bcb6a34498982a9cf3f50be67e27fab6e2c","observation_id":"c5f9debe-2b57-41a2-914f-90e7352b1446","resolution":{"observed_at":"2026-08-02T08:33:40.502503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1911.06854/citation-record","integrity":"/paper/1911.06854/integrity","json":"/paper/1911.06854/citation-record.json","paper":"/paper/1911.06854"},"outbound":[],"paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:1911.06854."}