{"as_of":"2026-08-06T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:221d9b1009b836f670e725c5f630c6a26f3f46acce5a50e36f82d1568cfcbb20","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:33:37.674295Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T14:33:54.438896Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:8261c0b48a552256a47ffa1dd0005aef0c5879d40ad63ec8f4c2134cbaf5f4ff","observation_id":"dcb8eeaf-0b4c-4764-8eac-50538e18f1bf","resolution":{"observed_at":"2026-05-12T23:19:17.364644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":188,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:db649b97e954b947652417d8b1d2a1d9c2f39a6c80e5940696ab06db56e2c08e","observation_id":"d2a39515-e24d-4a8e-95ce-8949f9310bc1","resolution":{"observed_at":"2026-05-11T11:33:21.191873Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T04:42:52.627166Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2210.00030"},"observation_digest":"sha256:2098e90e99f7aeaf9c6e9724e238a795231a8cba83f0c022cdfe5a5c379e776d","observation_id":"32019995-bd75-40ec-881c-00b64ac69c3d","resolution":{"observed_at":"2026-05-15T04:42:52.757965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2408.08812","last_updated":"2026-05-20T00:39:52Z","snapshot_observed_at":"2026-08-01T12:18:53.695004Z","submitted_at":"2024-08-16T15:47:08Z","title":"TRAM: Test-Time Risk Adaptation with Mixture of Agents","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T22:15:03.665956Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2408.08812"},"observation_digest":"sha256:aa0e88b41ee2ad452907580f83b65dd4c0767ae2f9eeecb2b8b8613fe1b943ca","observation_id":"c9c4ecd0-d1ff-49e4-a265-cf6149f78de6","resolution":{"observed_at":"2026-05-23T22:15:49.930546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2510.01479","last_updated":"2026-05-17T15:36:55Z","snapshot_observed_at":"2026-07-06T22:31:24.978726Z","submitted_at":"2025-10-01T21:43:04Z","title":"Density-Ratio Weighted Behavioral Cloning: Learning Control Policies from Corrupted Datasets","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T20:52:08.062450Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2510.01479"},"observation_digest":"sha256:d29f609124e10397fadc89cd49a06fe17fdd8631d8eeae8cf621dc39f60698a9","observation_id":"4dda242e-b6ad-483e-aaad-dc33477ab5ea","resolution":{"observed_at":"2026-05-21T20:54:21.646502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2512.23805","last_updated":"2026-05-07T18:46:25Z","snapshot_observed_at":"2026-07-06T22:40:17.725041Z","submitted_at":"2025-12-29T19:04:40Z","title":"Fitted $Q$ Evaluation Without Bellman Completeness via Stationary Weighting","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T19:05:34.417424Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2512.23805"},"observation_digest":"sha256:646b11cad4d69454911cb049b8e580db1441c80f2390590e1ee0f7e0365822a8","observation_id":"2ac92e50-3ed8-47c2-9e22-a21e3f1f4c93","resolution":{"observed_at":"2026-05-16T19:08:19.125336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2512.23927","last_updated":"2026-05-07T21:18:45Z","snapshot_observed_at":"2026-08-02T14:23:14.692750Z","submitted_at":"2025-12-30T00:58:35Z","title":"Stationary Reweighting Yields Local Convergence of Soft Fitted Q-Iteration","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T19:53:23.616808Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2512.23927"},"observation_digest":"sha256:979f41aef1559123769d3a2e1eb52abf131d9398536212969117ce381b577c3d","observation_id":"4bc2a7c4-9efc-49f5-bb6b-2d652d0c73b7","resolution":{"observed_at":"2026-05-16T19:58:23.626145Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2607.05375","last_updated":"2026-07-28T16:20:46Z","snapshot_observed_at":"2026-08-03T18:27:44.754369Z","submitted_at":"2026-07-06T17:53:32Z","title":"Fitted Occupancy-Ratio Evaluation without Bellman Completeness","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-07T14:25:33.921937Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2607.05375"},"observation_digest":"sha256:a61e9fa71c4f48e08fb65e64051f7ca07bb0e4ce263cfa62d9e02140e284ec29","observation_id":"0514f7e0-b419-4bde-9229-2b6153f84a2d","resolution":{"observed_at":"2026-07-07T14:33:54.440537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-02T08:33:37.674295Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05375","last_updated":"2026-07-28T16:20:46Z","snapshot_observed_at":"2026-08-03T18:27:44.754369Z","submitted_at":"2026-07-06T17:53:32Z","title":"Fitted Occupancy-Ratio Evaluation without Bellman Completeness","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T08:33:37.674295Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2607.05375"},"observation_digest":"sha256:bc34ca71b7133d84bd911e3a1415c1570fbdcb865240fef78395b16d7f992ab9","observation_id":"721e975c-8175-4b72-beb9-9e47c0d1c7e0","resolution":{"observed_at":"2026-08-02T08:33:37.674295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-01T17:45:17.002355Z","title":"arXiv preprint arXiv:1912.02074 , year=","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:17.002355Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:a8930efa31c7e1c9e4ab99b81a1fb454f209f7f291ade3225954af4ed6fc86d0","observation_id":"45db64a5-2846-44ee-b5bf-ed1199eeea35","resolution":{"observed_at":"2026-08-01T17:45:17.002355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-01T13:15:13.026138Z","title":"Nachum, B","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.19199","last_updated":"2026-07-21T15:34:06Z","snapshot_observed_at":"2026-08-01T13:15:09.438065Z","submitted_at":"2026-07-21T15:34:06Z","title":"Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:15:13.026138Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2607.19199"},"observation_digest":"sha256:ee969cc6c4cac6033591e7a34c51e3522819edae5453d226ea865ba30eb9e500","observation_id":"b99b10e1-b87a-4a00-ac19-a794a8110f1e","resolution":{"observed_at":"2026-08-01T13:15:13.026138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1912.02074/citation-record","integrity":"/paper/1912.02074/integrity","json":"/paper/1912.02074/citation-record.json","paper":"/paper/1912.02074"},"outbound":[],"paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:1912.02074."}