{"as_of":"2026-08-17T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5776bee961ed0c530978100f15a620705559eb40725d4462238c853b3f5bd940","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":2,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":2,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:25:39.404839Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T11:33:21.339028Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1811.06225","last_updated":"2018-11-15T08:18:33Z","snapshot_observed_at":"2026-08-14T17:58:54.861799Z","submitted_at":"2018-11-15T08:18:33Z","title":"Reward-estimation variance elimination in sequential decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06225","snapshot_observed_at":"2026-08-14T14:25:39.404839Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.404839Z"},"links":{"cited_paper":"/paper/1811.06225","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:11b13725194f2c4a81192eab8a12ce74a09a5d620ee56120f3c6b14d9d88fb2b","observation_id":"371e0090-7036-4b0c-a91b-ec496ff7e2e3","resolution":{"observed_at":"2026-08-14T14:25:39.404839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06225","last_updated":"2018-11-15T08:18:33Z","snapshot_observed_at":"2026-08-14T17:58:54.861799Z","submitted_at":"2018-11-15T08:18:33Z","title":"Reward-estimation variance elimination in sequential decision processes","version":1},"cited_work":{"arxiv_id":"1811.06225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1811.06225","snapshot_observed_at":"2026-07-04T23:12:18.373580Z","title":"arXiv preprint arXiv:1811.06225 , year=","venue":null,"work_id":"2effbeef-7cbb-455b-af44-c52cbad14100","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":247,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1811.06225","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:eea2020ec161eb2b77427e319457c1a3b5902383693a5c988a8718c0a69a4361","observation_id":"48572385-853a-406b-aced-6e1e48d34b12","resolution":{"observed_at":"2026-07-04T23:12:18.373580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1811.06225/citation-record","integrity":"/paper/1811.06225/integrity","json":"/paper/1811.06225/citation-record.json","paper":"/paper/1811.06225"},"outbound":[],"paper":{"arxiv_id":"1811.06225","last_updated":"2018-11-15T08:18:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T17:58:54.861799Z","submitted_at":"2018-11-15T08:18:33Z","title":"Reward-estimation variance elimination in sequential decision processes"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 2 inbound Pith citation observations for arXiv:1811.06225."}